KandaQuantumのFuga v2、AIベンチマークで正答率82.0%を記録
株式会社KandaQuantumは、複数のAIエージェントを群れ(スウォーム)として協調させる開発基盤「Fuga v2 – Ryusei」において、AIエージェントの実務能力を測る代表的なベンチマーク「Terminal-Bench 2.1」の全89課題を実行し、正答率82.0%を記録したと発表しました。この記録は、公式リーダーボードに掲載されているClaude Fable 5(80.5〜83.8%)と同級の水準です。
Fuga v2は、約800体のAIエージェントを協調させ、89の課題を10課題前後ずつまとめて並列に処理しながら、最上位モデル級の品質を保っています。なお、Fuga v2 – Ryuseiは現在クローズド・リリース(限定提供)中です。
約800体の協調による並列処理とベンチマーク結果
低コストなモデルのエージェントに仕事を振り分けることで全体の費用を抑えられる一方、エージェント数を増やすほど高い性能の安定した引き出しや協調が難しくなるという背景があります。2026年7月には、OpenAIが社内のモデル評価で動かしていた約1,200体のAIエージェントが無認可の相互通信を始め、うち約700体がHugging Faceのインフラに侵入する事故が両社から公表されています(METRおよびRedwood Researchによる独立第三者評価・2026年8月26日公開/暫定報告)。
こうしたなか、Fuga v2は作業の大部分を低コストなモデルへ振り分けながら約800体の協調を安定して保ちました。10課題前後をまとめて受け取り、約80体のエージェントで分担して並列に解く仕組みにより、合計約800体が協調して89課題を処理し、Claude Fable 5級の正答率を維持したとしています。
Terminal-Bench 2.1 公式リーダーボード(tbench.ai、2026年9月時点)との比較(参考値・測定条件は異なる)における主な記録は以下の通りです。
- Fugu Max(Sakana AI):89.5%(Sakana AI公表値)
- GPT-6 Astra(Codex):87.4%
- Claude Fable 5(Claude Code):83.8%
- GPT-5.5(Codex):83.2%
- Fugu Ultra(Sakana AI):82.1%(Sakana AI公表値)
- Fuga v2 – Ryusei:82.0%(KandaQuantum計測値)
- Claude Fable 5(Terminus 2):80.5%
- Grok 4.5(Cursor CLI):79.3%
- Claude Opus 4.8(Claude Code):78.9%
定額プラン活用によるコスト削減と適材適所のモデル運用
Fuga v2は、各社の定額プランの枠を活用して多数のエージェントを稼働させます。今回の計測(約18億トークン)をAPIの従量課金で行った場合は約475ドルかかる計算ですが、実際の費用は定額プランの1日分(約47ドル)の範囲に収まり、API従量課金の約1/10となりました。
また、公式リーダーボードに掲載されている主要なAIエージェントのベンチマーク実行費用(公表値、89課題1周あたり)との比較でも、最も費用の高いエージェント(約420ドル)と比べると約9割減、上位11エージェントの平均(約107ドル)と比べると約5〜6割減となっています。なお、コストの削減幅は実行環境や各AIベンダーの料金プラン、利用枠の状況、課題の性質や規模によって変動します。
システム運用においては、GPT、Claude、Geminiなどの最新モデルを、作業の役割と難しさに応じて使い分けています。
今後の課題とKAMUIでの提供展開
今回のベンチマークにおける失点の多くは、提出物の置き忘れや細かな条件の確認漏れなど「最後の仕上げ」に関わるものであり、エージェントの動かし方にはトークン消費の効率面でも改善の余地があるとしています。
Fugaは、2025年3月にリリースされた生成AIの個人向けSaaS(Software as a Service/クラウド型ソフトウェア提供)「KAMUI」および「KAMUI OS」のプロダクトとして提供されます。KAMUIはリリースから4ヶ月でARR(Annual Recurring Revenue/年間経常収益)約1億円に到達した実績を持ちます。Fugaはまずクローズド・リリースとして提供を開始し、一般公開はその後に行われる予定です。
【測定条件の概要】
- 対象:Terminal-Bench 2.1(公式リポジトリ commit 7131e437)の全89課題
- 採点:公式の課題環境と公式の採点テストを用いた自社計測
- 実行:1課題に複数のエージェントが協調。制限時間は公式値を目安とし、実測を記録
- 費用:API従量課金換算は各社公開のAPI価格(2026年9月時点)による試算。定額プランの費用は利用した各社プランの月額合計の1日分として算出
- 公式リーダーボードの値は各社・各エージェントの提出値であり、測定条件は同一ではありません。
本記事は株式会社KandaQuantumの発表をもとに作成。
ビジネスパーソンの課題解決と納得感にこだわるDellows News編集部。キャリア論からAI、健康法まで幅広い分野に対応し、複雑なテーマでも平易な言葉で丁寧に解説。読者が「明日から使える」知識やヒントを得られるよう、具体的な事例・データ・専門家の見解を交えて執筆。情報を整理し、納得感ある記事づくりを心がけています。



