Dellows News

エーアイセキュリティラボ、脆弱性解析AIでCyberGym首位スコア上回る

株式会社エーアイセキュリティラボは、自社開発したセキュリティ特化モデル「ASL-Cyber-Flash」が、脆弱性解析ベンチマーク「CyberGym」のLevel 1において、公式リーダーボードのModel-focused部門首位スコア(2026年9月10日時点)を上回るスコアを記録したと発表しました。

同モデルは、DeepSeek社がMITライセンスで公開するオープンウェイトモデル「DeepSeek-V4-Flash-0731」(304Bパラメータ)をベースに、同社独自のセキュリティ専用データセットでSFT(教師あり微調整)を施したものです。

高い再現成功率と低コストを両立した測定結果

「ASL-Cyber-Flash」の検証では、Level 1の全1,507タスク中1,297タスクで検証済み成功(verified_success)を収め、86.07%の再現成功率を記録しました。測定における主な条件と結果は以下の通りです。

  • 再現成功率:86.07%(全1,507タスク中1,297タスクでverified_success)
  • 試行条件:Pass@1(1タスク1試行、複数試行やアンサンブルは不使用)
  • 運用コスト:NVIDIA B300を1基のみ用いた自社vLLM環境にて、約30 GPU時間、総額約240ドル(1タスクあたり約0.16ドル)で全タスクを完走
  • 評価条件:dynamic(test-time memoryは不使用)
  • 前提条件:Web検索系ツールを無効化し外部からの解答混入を遮断、修正済みリポジトリおよび正解PoCをモデルから秘匿

CyberGymは試行回数を増やすとスコアが上振れする仕組みですが、今回の測定は最も厳しい試行条件下で実施されました。

特化学習による性能向上と実用上の強み

今回の成果について同社は、モデル規模の拡大ではなく対象領域に絞った学習データの設計が中核であるとしています。DeepSeek社が公表しているベースモデルのCyberGymスコアは76.7%(同社ハーネスによる測定値)であり、特化学習が脆弱性再現能力の向上に寄与したことが示されました。

また、単一GPUで動作し外部APIに依存しないため、コードを社外に持ち出せない環境やオンプレミス環境での運用にもそのまま適用可能です。同社は本結果について、絶対的な優劣ではなく、軽量なオープンウェイトモデルと特化学習の組み合わせによってフロンティアモデル水準の能力に到達しうることの実証であると位置づけています。

評価フレームワーク「CyberGym」について

CyberGymは、カリフォルニア大学バークレー校の研究チームが開発した、AIのサイバーセキュリティ解析能力を測定する大規模評価フレームワークです。Googleの「OSS-Fuzz」で特定された実在の脆弱性データを基に構築されており、数千ファイル規模のコード解析から概念実証の自動生成までを検証します。先端AI研究の国際会議「ICLR 2026」にも採択されています。

今後の展望と会社概要

株式会社エーアイセキュリティラボは今後も高度な検証手法を通じた研究開発を継続し、脆弱性解析技術の精度や検出スピードの向上を図る方針です。本研究の知見や技術は、クラウド型Web診断サービス「AeyeScan」のエンジンへ順次還元・実装され、診断精度の高度化と低コスト化の両立を目指します。

株式会社エーアイセキュリティラボの概要は以下の通りです。

  • 代表者:代表取締役社長 青木 歩
  • 所在地:東京都千代田区神田錦町 2-2-1 KANDA SQUARE WeWork
  • 設立:2019年4月
  • 業務内容:情報セキュリティ関連事業(調査・コンサルティング)、クラウド型Web診断サービス「AeyeScan」提供
  • URL:https://www.aeyesec.jp/

本記事は株式会社エーアイセキュリティラボの発表をもとに作成しました。

アクセスランキング

今日

1週間