GPT-5.4 ProがAI総合首位 OrcaRouterの独自指標で
FlashLabs株式会社は、日本市場向けに独占提供するAI推論ゲートウェイ「OrcaRouter」において、「OrcaRouter Model Leaderboard」を更新しました。独自指標「Composite Index」において、OpenAIの「GPT-5.4 Pro」が総合1位を獲得しています(2026年9月21日時点・同社調べ※1)。前回の更新(2026年9月1日時点)で首位だった「GPT-5.6 Luna」と順位が入れ替わりました。
OpenAIのモデルが上位に集中 コスト差も可視化
今回の更新では、1位の「GPT-5.4 Pro」、3位の「GPT-6 Astra」、4位の「GPT-5.6 Luna」と、上位4位のうち3つをOpenAIのモデルが占める結果となりました※1。総合2位には「DeepSeek V4.1 Flash」が入り、5位に「Claude Opus 5」、6位に「Claude Fable 5.1」とAnthropicのモデルが続いています※1。
総合2位の「DeepSeek V4.1 Flash」は入力100万トークンあたり0.15米ドル、出力100万トークンあたり0.60米ドルで提供されており、1位の「GPT-5.4 Pro」(入力60.00米ドル/出力270.00米ドル)と比べて2桁以上安い価格設定となっています※1。同リーダーボードでは、性能と価格を同じ指標で比較可能です。
4つの要素を統合した独自指標Composite Index
「Composite Index」は、単一のベンチマーク結果に依存せず、複数の観点を固定の重みで統合した指標です。AIモデル事業者による自己申告を含まず、すべて実測値で構成されています※1。
- 人間の選好(40%):ブラインドでの対戦・投票に基づく評価(LMArena)
- 独立ベンチマーク(30%):第三機関による独立した指標
- OrcaRouter本番実績(20%):OrcaRouter上での実トラフィックに基づく実測値
- エコシステム採用度(10%):実際の利用の広がりを示す採用度
新モデルは公開から48時間以内にリストへ追加され、毎日同じルールで再計算が行われます※1。
2026年9月21日時点のトップ10ランキング
2026年9月21日時点におけるリーダーボードの上位10モデルとスコアは以下の通りです※1。
- GPT-5.4 Pro(OpenAI):82.3
- DeepSeek V4.1 Flash(DeepSeek):77.8
- GPT-6 Astra(OpenAI):76.5
- GPT-5.6 Luna(OpenAI):74.9
- Claude Opus 5(Anthropic):73.4
- Claude Fable 5.1(Anthropic):73.3
- GPT-5.6 Sol(OpenAI):72.7
- GLM 5.3(Z.ai):72.6
- GLM 5.3 Flash(Z.ai):70.6
- Kimi K3(Moonshot AI):68.4
順位、スコア、料金、応答速度、成功率などの実測値は、OrcaRouter Model Leaderboardで常時確認できます※1。
OrcaRouterのサービス概要
OrcaRouterは、米国のAI研究機関Continuum AIが開発し、東京都千代田区に本社を置くFlashLabs株式会社(代表取締役:細井洋一)が日本市場向けに独占提供するAI推論ゲートウェイです。OpenAI互換のAPIを備え、Anthropic、OpenAI、Google Gemini、DeepSeek、Grok、Qwenなど200以上のLLM・生成AIモデルを単一のゲートウェイから利用できます。
新モデルの追加や利用実績の蓄積に応じてスコアは毎日更新され、モデル選定の判断材料を提供していくとしています。
※1 順位・スコア・料金・指標の構成に関する記述は、OrcaRouter Model Leaderboard(当社確認・2026年9月21日時点)に基づきます。同リーダーボードのスコアは毎日更新されるため、掲載時点の値と異なる場合があります。上位モデルの一部は、証拠が2系統そろった段階の暫定スコアです。
本記事はFlashLabs株式会社の発表をもとに作成しました。
ビジネスパーソンの課題解決と納得感にこだわるDellows News編集部。キャリア論からAI、健康法まで幅広い分野に対応し、複雑なテーマでも平易な言葉で丁寧に解説。読者が「明日から使える」知識やヒントを得られるよう、具体的な事例・データ・専門家の見解を交えて執筆。情報を整理し、納得感ある記事づくりを心がけています。



