top of page

SpaceXAI、「Grok 4.7」発表 長時間のコーディング性能を強化

執筆者の写真: 白石 奈々
白石 奈々
2 日前
読了時間: 2分

SpaceXAI、「Grok 4.7」発表 長時間のコーディング性能を強化
image : SpaceXAI

新ベースモデルと長時間RLで性能を向上、CursorBenchやEEBenchなど主要ベンチマークでも改善


 米SpaceXAIは現地時間9月21日、コーディングやエージェントタスク、知識業務に特化したフラッグシップモデル「Grok 4.7」を発表した。前世代の「Grok 4.6」と同じ価格で、より大規模な新しいベースモデルと、難度の高いタスクに重点を置いた長時間の強化学習(RL)トレーニングにより性能を向上させた。CursorとGrok Buildで同日から利用できるほか、xAI API、サードパーティーのコーディングハーネス、モデルルーター、クラウドプラットフォームでも提供する。


長時間タスクへの対応力と自己検証能力を強化

 Grok 4.7では、数時間にわたる難度の高いタスクに重点を置いたトレーニングを実施。長時間タスクへの対応力に加え、自身の作業を検証する能力や長いコンテキストを管理する能力を高めた。また、Grok Botのハーネスをネイティブに理解するよう学習させ、会話タスクや一般的な知識業務にも対応する。


 ベンチマークでは、長時間のコーディングタスクを評価するCursorBench 4.0で、Grok 4.6の40.4%から46.3%に向上。電気工学分野を評価するEEBenchでは、53.0%から64.0%へ改善した。法律業務を評価するHarvey Legal Agent Benchmarkでは19.6%を記録し、Grok 4.6の15.8%から向上したほか、GPT-5.6 Solの2.5%、Fable 5.1の6.7%も上回った。


SpaceXAI、「Grok 4.7」発表 長時間のコーディング性能を強化
image : SpaceXAI


安全対策を刷新、サイバーセキュリティや生物学分野も強化

 安全対策も刷新した。SpaceXAIによると、Grok 4.7は同社がこれまでテストしたモデルの中で、拒否能力とジェイルブレイク耐性が最も強いという。サイバーセキュリティ分野では、危険なサイバータスクを評価するHackerBench v0.3で、危険な二重用途プロンプトの通過率を3.3%に抑えながら、正当なセキュリティ業務への拒否は低く抑えたとしている。生物安全性のベンチマーク「LatchBio」では62.4%を記録した。一部のサイバーセキュリティパートナーには、招待制でGrok 4.7のレッドチーム能力へのアクセスも提供する。


価格は据え置き、高速版「Grok 4.7 Fast」も提供

 Grok 4.7の料金は、入力100万トークンあたり2ドル、出力6ドル。キャッシュされた入力は100万トークンあたり0.5ドルで、200Kトークンを超えるリクエストでは入力4ドル、出力12ドルとなる。出力速度を2倍にした「Grok 4.7 Fast」は、通常版の2倍のトークン料金で提供する。Fast版はCursorとGrok Buildのみで利用でき、xAI APIでは提供しない。通常版はxAI APIのほか、モデルルーターやクラウドプラットフォームなどでも利用できる。



参照サイト

SpaceXAI News

Introducing Grok 4.7



TAGs


bottom of page