OpenAIは、GPT‑6 Solのアップグレード版となるGPT‑6.1 Solを公開しました。エージェント型コーディングやコンピューター操作、専門業務、科学研究、事実の正確性で性能が向上し、標準の入力と出力の料金はGPT‑6 Astraの5分の1に設定されています。API料金は100万トークンあたり入力2ドル、キャッシュ済み入力0.10ドル、出力10ドルで、キャッシュ済み入力は標準入力から95パーセント割引です。提供は本日からで、Plus、Pro、Business、Enterprise、Eduの各プランがChatGPT WorkとCodexで利用できます。開発者はgpt-6.1-solとしてOpenAI APIから利用可能で、Astraに迫る性能をSolの価格帯で使える点が特徴です。加えて、GPT‑6 Astra UltrafastとGPT‑6.1 Sol Ultrafastの提供も始まり、APIのほか月額500ドルのProティアではChatGPT WorkとCodexでも利用できます。
評価結果では、実コードベースで測るDeepSWE v1.1で、GPT‑6.1 Solは約5分の1のコストでAstraと同等の性能を示し、GPT‑6 Solの最高スコアを6.4ポイント上回りました。複雑なPDFでの専門的QAを測るGDP.pdfでは、フォールバックを用いるOpus 5.5より高スコアを半分未満のコストで記録し、Astraに近い水準とされます。AutomationBenchでは、思考量中設定でOpus 5.5を2.2ポイント上回り、同設定のGPT‑6 Solにも4.8ポイント差を付けました。OSWorld 2.0のオフラインセットでは、思考量最大時にGPT‑6 Solを7ポイント上回り、Astraとの差を2.1ポイントに縮めています。科学分野のTerminal-Bench Science 0.1では、GPT‑6 Solの2倍超のスコアを半分未満のコストで達成し、タスクあたりの平均コストは5.47ドルでした。事実の正確性でも、事実誤認率が4.1パーセントとなり、Astraの4.0パーセントに近づいています。
安全面では、GPT‑6.1 Solがアラインメント評価で改善し、検索ツールの不具合を伝えない割合が2.1パーセントまで低下したとされています。明示的な制限の順守やエージェント動作中の無許可の結果発生を抑える点でも、GPT‑6 Solより失敗率が低いとされます。提供状況として、Chatでは未提供で、APIとChatGPT Work、Codexを中心に利用が可能です。Astraは引き続き最上位モデルとして位置付けられ、最難度の科学研究タスクにはAstraの利用が推奨されます。今回の発表は、能力とコストのバランスを重視するユーザーや大規模運用を目指すAPIユーザーにとって、選択肢の拡大につながる内容です。
詳しくは「OpenAI」の公式ページまで。レポート/DXマガジン編集部





















