LLMエージェント

全産業共通

同じ質問に毎回違う答えを返すAIは、現場では使えない — 産業用LLMの「一貫性」を再学習なしで上げる5手法の比較

社内AIが業務に組み込めない理由は、間違うことより「毎回違うことを言う」ことにある。産業用LLMの一貫性を、モデル再学習なしで改善する5手法を比較した研究では、最も効いたのがプロンプトの工夫ではなく参照データの構造化だった。ただし一貫性の改善は正しさを保証しない——導入時に外してはいけない線引きまで整理する。
全産業共通

契約リスク条項の抽出は、どこまで任せられるか — 19モデル・41類型が示す到達点と使いどころ

契約書のリスク条項抽出を、実在する商用契約102件・41リスク類型・19モデルで測ったベンチマーク。最良でもF1値0.641、オープンソース最良は専有モデルに約16%劣後し、さらに「該当条項なし」と誤って答える率が一部モデルで30%を超える。置き換えではなく二次チェックの網として使う線引きと、正直なROI試算を示す。
製造・組立

生産計画にLLMを使うなら、期待すべきは最適解ではなく安定性 — 10モデル検証でわかった使いどころ

「生成AIが生産計画を最適化します」という提案を、10種類のLLMと24通りの従来ルールで同一条件比較した論文が出た。最良のLLMは数十年前からある単純な優先順位ルールと統計的に区別がつかず、さらに工場の完全な構造情報を渡すと要約だけの場合より2.6倍悪化した。それでもLLMを使う意味はどこにあるのか、判断軸とROIを整理する。