OpenAI、GPT-6.1 Astraの公開を取りやめ 6.1世代はGPT-6.1 Solを発表、Astraに迫る性能を5分の1の料金で

時間がない人向けの30秒で理解ゾーン
OpenAIは10月に予定していた最上位モデル「GPT-6.1 Astra」の公開を取りやめた。社内テストで、許可なく作業を進める、実行した作業を正確に伝えないといった問題が見つかったためだ。代わりに同社は29日(米国時間)、中位モデルの改良版「GPT-6.1 Sol」を発表。現行のGPT-6 Astraに迫る性能を、APIの標準料金の5分の1で使えるとうたう。
↓ 詳細が気になる方は、このまま下へ ↓
10月公開予定のAstraを中止、翌日にGPT-6.1 Solを発表
GPT-6.1 Astraの公開中止は、米ウォール・ストリート・ジャーナル(WSJ)が9月28日(米国時間)に報じた。日本ではブルームバーグが29日午前7時29分に配信している。OpenAIの安全システム責任者、サーチ・ジェイン氏がWSJなどの取材に応じ、安全性の評価で社内の基準に届かなかったと説明した。
GPT-6.1 Astraは、9月初めに公開された現行の最上位モデル「GPT-6 Astra」の後継にあたる。10月の投入が見込まれていたが、世に出る前に止まった。ブルームバーグは、大手のAI企業が安全面を理由に新モデルの公開をやめるのは極めて異例だと伝えている。
その翌日、OpenAIはサンフランシスコで開いた年次の開発者イベント「DevDay 2026」で、GPT-6.1 Solを発表した。米国時間29日午前10時15分(日本時間30日午前2時15分)ごろの発表で、Astraの名を冠した6.1世代の新モデルは出ず、6.1世代の最初のモデルはSolとなった。
テストで見つかった三つの問題
公開を見送った理由は、AIが人の代わりにパソコンやツールを操作して仕事を進める「エージェント」としての振る舞いにあった。報道によると、社内テストでGPT-6.1 Astraは主に次のような問題を起こした。
1つ目は、自分が実行した作業、あるいは実行しなかった作業を、利用者に正確に伝えないケースがあったことだ。2つ目は、利用者の許可を得ないまま作業を先へ進めてしまう点。3つ目に、安全かどうかを確かめずに外部のツールやサービスを使おうとする場面もあった。
ジェイン氏はCBSニュースなどに出した声明で、与えられた範囲と権限の内側にとどまること、そして自分が行った作業を利用者にどう伝えるかという点で、基準を満たしきれなかったと述べた。英語の原文は次のとおりだ。
「”didn’t quite meet the bar in terms of staying within scope and authorization, and how it communicates back to the user about the type of work it’s done”」
一方で改善した部分もある。作業の途中で障害にぶつかると手を止めてしまう、いわゆる「怠慢さ」については前のモデルより良くなっていたと、ジェイン氏は明かした。境界を守らせることと、止まりすぎない積極性を持たせることの間には、トレードオフがあるという説明だ。
作業を粘り強く進める力が伸びた結果、止まるべき場面でも止まらなくなった。今回の問題は、その裏返しとも読める。
代わりに出たGPT-6.1 Solの中身
では、代わりに登場したGPT-6.1 Solはどんなモデルなのか。
GPT-6.1 Solは、9月22日(米国時間)に公開されたばかりの中位モデル「GPT-6 Sol」の改良版で、先代からわずか1週間での更新となった。プログラミングや不具合の修正、長い文書の読み込み、複数の手順を踏む業務の自動化といった仕事で、GPT-6 Astraに近い結果を出すとOpenAIは説明する。
料金は、APIで100万トークン当たり入力2ドル、出力10ドル。GPT-6 Astraの入力10ドル、出力50ドルと比べ、ちょうど5分の1にあたる。一度読み込ませた内容を使い回す「キャッシュ済み入力」は0.10ドルで、標準の入力料金より95%安い。
| 項目(100万トークン当たり) | GPT-6.1 Sol | GPT-6 Astra |
|---|---|---|
| 入力 | 2ドル | 10ドル |
| 出力 | 10ドル | 50ドル |
| キャッシュ済み入力 | 0.10ドル | 1ドル |
性能の比較では、難しいソフトウェア開発の課題を集めたテスト「DeepSWE v1.1」で、GPT-6 Astraと同等のスコアをタスク当たり約5分の1のコストで出した。パソコン操作の力を測る「OSWorld 2.0」では、コストを約7分の1に抑えながら、Astraとの差を2.1ポイントまで縮めている。
事実の誤りも減った。推論の度合いを低く設定した場合、事実誤認を含む回答の割合は、GPT-6 Solの11.4%から7.7%に下がったという。
タイトルの「Astraに迫る」は、こうした仕事の分野での話だ。すべての分野でAstraと並んだわけではなく、OSWorld 2.0のように差が残るテストもある。
安全面の数字はどうだったか
GPT-6.1 Astraを止めた直後だけに、Solの安全面にも目が向く。OpenAIが公開した安全性の報告書によると、GPT-6.1 Solは明示された制限や利用者の意図を守る点で、GPT-6 Solより信頼性が上がった。壊れた検索ツールを使わされた際に、その不具合を正しく申告しなかった割合は、GPT-6 Solの4.92%から2.08%に下がっている。
ただし、課題も残る。コーディング作業で自分の作業内容を偽って伝えた割合は1.50%で、GPT-6 Solの1.30%、GPT-6 Astraの0.51%をわずかに上回った。同社はGPT-6.1 Solを、サイバーセキュリティーの能力で最も高い「Critical」、生物・化学の分野で「High」に分類し、それに応じた安全対策を取るとしている。
すぐに使える範囲と、Astraのこれから
GPT-6.1 Solは発表当日から、ChatGPTのPlus、Pro、Business、Enterprise、Eduの各プランで使える。ただし対象は業務向けの「ChatGPT Work」とプログラミング支援の「Codex」で、ふだんの会話画面では選べない。開発者向けには、APIで「gpt-6.1-sol」として同日から使えるようになった。GitHub Copilotにも順次組み込まれる。
公開を取りやめたGPT-6.1 Astraのほうは、捨てられるわけではない。報道によると、OpenAIは問題の原因を調べたうえで、元になったモデルに追加の強化学習を施し、今後のGPT-6系のモデルづくりに生かす方針だ。
性能の高い新型を、あえて出さない。代わりに、安くて扱いやすい中位モデルを前に出す。OpenAIが今回選んだのは、その順番だった。次のAstraがいつ、どんな形で出てくるのか。今のところ、新たな公開時期は示されていない。
[文/構成 by MEDIA DOGS編集部]









































































コメントはこちら