Dellows News

GPT-5.4 ProがAI総合首位 OrcaRouterの独自指標で

FlashLabs株式会社は、日本市場向けに独占提供するAI推論ゲートウェイ「OrcaRouter」において、「OrcaRouter Model Leaderboard」を更新しました。独自指標「Composite Index」において、OpenAIの「GPT-5.4 Pro」が総合1位を獲得しています(2026年9月21日時点・同社調べ※1)。前回の更新(2026年9月1日時点)で首位だった「GPT-5.6 Luna」と順位が入れ替わりました。

OpenAIのモデルが上位に集中 コスト差も可視化

今回の更新では、1位の「GPT-5.4 Pro」、3位の「GPT-6 Astra」、4位の「GPT-5.6 Luna」と、上位4位のうち3つをOpenAIのモデルが占める結果となりました※1。総合2位には「DeepSeek V4.1 Flash」が入り、5位に「Claude Opus 5」、6位に「Claude Fable 5.1」とAnthropicのモデルが続いています※1。

総合2位の「DeepSeek V4.1 Flash」は入力100万トークンあたり0.15米ドル、出力100万トークンあたり0.60米ドルで提供されており、1位の「GPT-5.4 Pro」(入力60.00米ドル/出力270.00米ドル)と比べて2桁以上安い価格設定となっています※1。同リーダーボードでは、性能と価格を同じ指標で比較可能です。

4つの要素を統合した独自指標Composite Index

「Composite Index」は、単一のベンチマーク結果に依存せず、複数の観点を固定の重みで統合した指標です。AIモデル事業者による自己申告を含まず、すべて実測値で構成されています※1。

  • 人間の選好(40%):ブラインドでの対戦・投票に基づく評価(LMArena)
  • 独立ベンチマーク(30%):第三機関による独立した指標
  • OrcaRouter本番実績(20%):OrcaRouter上での実トラフィックに基づく実測値
  • エコシステム採用度(10%):実際の利用の広がりを示す採用度

新モデルは公開から48時間以内にリストへ追加され、毎日同じルールで再計算が行われます※1。

2026年9月21日時点のトップ10ランキング

2026年9月21日時点におけるリーダーボードの上位10モデルとスコアは以下の通りです※1。

  1. GPT-5.4 Pro(OpenAI):82.3
  2. DeepSeek V4.1 Flash(DeepSeek):77.8
  3. GPT-6 Astra(OpenAI):76.5
  4. GPT-5.6 Luna(OpenAI):74.9
  5. Claude Opus 5(Anthropic):73.4
  6. Claude Fable 5.1(Anthropic):73.3
  7. GPT-5.6 Sol(OpenAI):72.7
  8. GLM 5.3(Z.ai):72.6
  9. GLM 5.3 Flash(Z.ai):70.6
  10. Kimi K3(Moonshot AI):68.4

順位、スコア、料金、応答速度、成功率などの実測値は、OrcaRouter Model Leaderboardで常時確認できます※1。

OrcaRouterのサービス概要

OrcaRouterは、米国のAI研究機関Continuum AIが開発し、東京都千代田区に本社を置くFlashLabs株式会社(代表取締役:細井洋一)が日本市場向けに独占提供するAI推論ゲートウェイです。OpenAI互換のAPIを備え、Anthropic、OpenAI、Google Gemini、DeepSeek、Grok、Qwenなど200以上のLLM・生成AIモデルを単一のゲートウェイから利用できます。

新モデルの追加や利用実績の蓄積に応じてスコアは毎日更新され、モデル選定の判断材料を提供していくとしています。

※1 順位・スコア・料金・指標の構成に関する記述は、OrcaRouter Model Leaderboard(当社確認・2026年9月21日時点)に基づきます。同リーダーボードのスコアは毎日更新されるため、掲載時点の値と異なる場合があります。上位モデルの一部は、証拠が2系統そろった段階の暫定スコアです。

本記事はFlashLabs株式会社の発表をもとに作成しました。

アクセスランキング

今日

1週間