Dellows News

光数、日本語文書検索向け次世代小型AIモデルの基本設計を完了

光数株式会社は、2026年8月に研究開発開始を発表した日本語文書検索向け次世代小型AIモデルについて、基本設計を完了したと発表した。今後は設計に基づく実装や学習用データの整備、モデルの学習および評価を進める開発フェーズへ移行する。同社は特許や技術資料を最初の検証対象とし、日本語専門文書の検索に適したモデルの開発を進める。

文書取り込み時の事前解析で検索時の負荷を軽減

新モデルは、文書を取り込む際に内容を解析して検索に利用する情報を事前に保存し、検索時には利用者の検索条件を解析して保存済みの情報と照合する構成を採用している。

一般的な「Embeddingによる候補検索+Rerankerによる再評価」という構成では、検索のたびに候補文書と検索条件を別のAIモデルへ入力して評価を行う。これに対し新モデルでは、文書側の解析を取り込み時に済ませておくことで、事前に計算した情報を用いて照合や順位付けを行う。これにより、検索ごとの個別再評価処理を省き、検索品質を保ちながら応答時間と計算負荷を抑えることを目指す。

技術要素の一致を評価し原文の該当箇所と結び付け

専門文書の検索においては、話題の類似度だけでなく必要な条件や技術要素が含まれているかの確認が重視される。特許文書などでは、装置の構成や材料、処理手順、数値条件の違いが文献確認時の重要な判断材料となる。

新モデルでは文書の内容を複数の要素として保持し、検索条件との対応を評価する方式を採用する。さらに、検索に用いる情報を原文の該当箇所と結び付けることで、利用者が検索条件に対応する部分を確認できる仕組みを整え、専門業務における調査支援につなげる方針だ。

一般的なPCのCPUで動作するローカル構成を想定

利用環境としては、一般的なPCのCPUで動作するローカル構成を想定している。モデルと検索用データを端末内に保持することで、外部APIへの文書送信や常時インターネット接続を不要とする環境を目指す。

機密性の高い技術資料や社内文書を扱う企業など、クラウドサービスへの文書送信に制約がある環境での活用を見据え、検索品質に加えて処理時間、メモリ使用量、保存容量の検証を進めるとしている。

今後の実装・学習と既存方式との比較評価

設計の完了に伴い、今後は以下の開発に取り組む予定となっている。

  • 日本語の特許・技術文書を用いた学習用データと評価用データの整備
  • 新モデルおよび検索処理の実装と、モデルの学習
  • 既存のEmbeddingモデルやEmbedding+Reranker構成との比較評価
  • CPU環境での検索速度、メモリ使用量、オフライン動作の検証

光数は、NEDO「GENIAC-PRIZE」でのPoCを通じて得た知見を生かし、日本語専門文書の検索品質と実用的な処理効率の両立に向けて研究開発を進めるとしている。

本記事は光数株式会社の発表をもとに作成。関連情報は同社Webサイト(https://ai.wdx.jp)で公開されているほか、問い合わせはメール(ai@wdx.jp)で受け付けている。

アクセスランキング

今日

1週間