Dellows News

日立、相反する複数KPIを考慮し多様な候補を生成するLLM学習技術を開発

日立は、社会インフラや産業分野などで相反する複数のKPIを同時に考慮し、現場の用途や制約条件に応じて複数の候補を生成するLLM学習技術を開発した。従来の強化学習における候補の偏りや再学習の手間といった課題を解消し、異なるKPIバランスを持つ複数の案の提示を可能にする。論理回路設計分野の回路生成タスクにおける検証では、多様で有力な回路候補の網羅率が学習前のモデルと比較して最大13.3%向上することを確認したとしている。

開発の背景と課題

脱炭素やエネルギー価格の変動、安定供給への要求の高まり、人手不足などを背景に、社会インフラや産業分野では複数のKPIを同時に満たす意思決定の重要性が高まっている。例えば、鉄道・自動車の運行制御などのモビリティ分野では運行効率と消費電力の抑制、物流分野では輸送時間の短縮と電力コストの抑制といった、相反する指標の考慮が求められる。

AIを活用した最適化が進められているものの、従来のLLM向け強化学習では複数のKPIを1つの総合点にまとめて学習することが多く、特定のバランスに探索が偏りやすい問題があった。さらに、各KPIの優先度を変更して最適化するにはAIの再学習が必要となるため、現場の状況に応じて比較検討できる多様な候補を効率よく得ることが難しいという課題が存在していた。

候補群の性能と多様性を高める技術の特長

日立は、候補群全体の価値を高めながら複数の有力な候補をLLMに生成させる学習技術を開発した。本技術の特長は以下の2点となる。

  • 生成する候補群の性能・多様性を向上させる逐次学習技術

前回までに生成した候補を踏まえて次の候補を生成し、その候補が候補群全体の性能・多様性にどの程度貢献したかを評価しながら学習する仕組みを構築した。これにより、単一候補を生成・評価する既存のアルゴリズムを活かし、学習効率の低下を防ぎながら候補の性能と多様性を向上させる。

  • 異なるKPIバランスを持つ候補を生み出す強化学習

LLM向け強化学習手法のGRPOに、評価指標であるハイパーボリューム寄与度を適用した。これにより、似た候補の繰り返しではなく異なるKPIバランスを持つ候補を生成する方向へ学習を進め、限られた評価回数でも比較検討しやすい複数の有力候補を得やすくした。

回路生成タスクにおける検証効果

複数KPIを客観的かつ自動的に評価できる論理回路設計分野の回路生成タスクにおいて本技術の有効性を実証したところ、網羅率が学習前のモデルと比較して最大13.3%向上することを確認した。これにより、回路設計者が同じ仕様に対して「高速性を重視した回路」「省電力を重視した回路」「小型化を重視した回路」など、用途や製品要件に応じた複数の候補を比較しながら選択できることが示された。

なお、本研究の一部は国立大学法人東京科学大学岡崎研究室の協力を得て実施された。

今後の展望と学会発表

日立は今後、本技術を社会インフラ知能基盤モデルであるIntegrated World Infrastructure Model (IWIM)を支える意思決定高度化技術として位置づけ、有効性の検証を進める。モビリティ、物流、電力とデータ処理・通信を連携させるワットビット連携、回路設計などの分野への応用を検討し、意思決定支援の高度化を通じて安定運用と省エネルギー・生産性向上の両立に貢献していく方針だ。

本成果の一部は、2026年10月6日から8日に米国サンフランシスコで開催されるThe Third Annual Conference on Language Modeling (COLM2026)で発表される予定となっている。

本記事は株式会社日立製作所の発表をもとに作成。

アクセスランキング

今日

1週間