Dellows News

FlashLabs、27Bモデルを12.3GBに圧縮したAIモデルの公開を発表

FlashLabs株式会社は、米国のAI研究機関Continuum AIが開発し、同社が日本市場向けに独占提供するAI推論ゲートウェイ「OrcaRouter」の研究チームが、Qwen3.8-27Bを圧縮した「OrcaSAQ-2 27B」を公開したことを発表しました。同モデルは2026年9月24日にApache-2.0ライセンスで公開されました。

270億規模のパラメータを持つモデルのファイルサイズを54GBから12.3GBへ約4分の1以下に圧縮しながら、圧縮前のモデルと同じ判断を維持することを目指して開発されています。

高精度を維持しながら容量を77.2%削減

OrcaSAQ-2 27Bは、27B(270億パラメータ規模)のモデルを54GBから12.3GBに圧縮し、ストレージを77.2%削減しています。圧縮前のモデル(BF16)と比較した回答一致率(Top-1)は93.2%、文章生成の自然さを示すパープレキシティは5.6468から5.6482への変化にとどまり、差は+0.02%となっています。また、平均KLDは0.031を記録し、コンテキスト長は26万2144トークンを維持しています。

モデルの各部分が圧縮による影響を受けやすいかどうかを見極め、精度の配分を変える独自の混合精度圧縮方式「OrcaSAQ2」を採用しています。重み1つあたりの平均は3.21ビットで、影響の大きい部分に情報量を多く配分する設計となっています。なお、詳細な圧縮手法・調整方法・精度配分・パッキング方式は現時点で非公開とされています。

長期作業での利用を見据えた開発

27Bクラスのモデルはコーディングやツール操作などの作業に対応できる一方、元のBF16形式では54GBのメモリが必要となり、手元のGPUや1台のサーバーで動かすには大きすぎる課題がありました。

また、AIエージェントは「計画する→実行する→結果を見る→判断する→立て直す」という流れを繰り返すため、途中の判断が変わるとその後の判断に影響が蓄積します。OrcaSAQ-2 27Bは、長時間の作業で小さな誤差が蓄積して仕事が完了できなくなる問題に対応するため、「長期の作業で使えるか」を圧縮の評価軸に置いています。

16GBのGPUで動作可能な環境と性能

OrcaSAQ-2 27Bの重みは12.3GBで、16GBのGPUに収まるサイズです。実行にはvLLMとOrcaSAQ2の連携が必要となります。

15.7GiBのメモリ上限で計測された速度は、MTP(投機的デコーディング)有効時で1ストリームあたり毎秒90.1トークンです。MTPを無効にした場合は1ストリームで毎秒65.3トークン、8ストリームで毎秒332トークンとなります。16GBのGPUで動かす場合の実用的な開始点は対話用途で約3万2000トークンですが、モデルの仕様上の上限は26万2144トークンです。思考モード、ツール呼び出し、MTPに対応しています。

公開値との参考比較として実施された同社計測のベンチマークにおいて、コーディングエージェントの指標であるSWE-bench Verifiedでは70.0、ターミナル操作のTerminal-Bench 2.1では58.4を記録しました。

主なベンチマークの参考比較値(当社計測・公開値との比較)は以下の通りです。

SWE-bench Verified

  • Claude Sonnet 4.6:79.6
  • Claude Sonnet 4.5:77.2
  • Gemini 3:76.2
  • OrcaSAQ-2 27B:70.0
  • Qwen3-Coder-480B-A35B:69.6
  • Gemini 2.5 Pro:63.8
  • GPT-4.1:54.6

Terminal-Bench 2.1

  • Gemini 3.1 Pro/Terminus 2:70.7
  • Claude Opus 4.6/Claude Code:70.1
  • Claude Opus 4.6/Terminus 2:63.8
  • Claude Sonnet 4.6/Claude Code:58.5
  • OrcaSAQ-2 27B:58.4
  • Gemini 3 Flash/Gemini CLI:56.9
  • GPT-5.4/Terminus 2:54.8

提供形式と今後の展望

OrcaSAQ-2 27Bはテキスト入力のみに対応し、画像入力には対応していません。Hugging Faceを通じて重み一式が公開されており、ライセンスは圧縮前のQwen3.8-27Bから引き継がれるApache-2.0が適用されます。

FlashLabsは、AIエージェントの導入を検討する日本の企業や開発者に対して、高性能なモデルを現実的な設備で運用するための選択肢を紹介していく方針です。同社が独占提供するAI推論ゲートウェイ「OrcaRouter」では、用途に応じたモデルの選択環境や、実行記録の確認・ガードレールなどの運用機能が提供されています。

関連情報

FlashLabs株式会社

  • 本社所在地:東京都千代田区一番町10番8号
  • 代表取締役:細井洋一
  • 設立:2023年7月
  • 事業内容:AI応用研究所(Human-AI Hybridで営業・CXの自動化・自律化。OSS音声モデルChromaの開発元)
  • URL:https://www.flashlabs.ai/

Continuum AI

  • 事業概要:次の10年の知能システムを支える基盤インフラを開発する研究機関(米国)、OrcaRouterの開発・提供
  • URL:https://www.continuum01.ai/

モデル配布URL

  • Hugging Face:https://huggingface.co/orcarouter/OrcaSAQ-2-27B

本記事はFlashLabs株式会社の発表をもとに作成されています。

アクセスランキング

今日

1週間