アマゾン、RAGを実装したAIの性能を比較する新しいベンチマークを提案

Tiernan Ray (Special to ZDNET.com) 翻訳校正: 佐藤卓 吉武稔夫 (ガリレオ)

2024-07-02 09:38

 2024年は、企業で生成人工知能(AI)の活用が飛躍的に進む年になると、多くの観測筋が予測している。考えられる可能性の1つが、検索拡張生成(RAG)と呼ばれる手法の採用だ。RAGを利用すると、AIの大規模言語モデル(LLM)を、企業のファイルなど、組織の独自コンテンツが含まれるデータベースに接続できる。

 ただし、RAGはまだ新しい技術で、落とし穴もある。

 そのため、AmazonのAWSの研究者たちは新しい論文の中で、RAGが組織の独自コンテンツに関する質問にどれほど正しく回答できるかをテストする一連のベンチマークの策定を提案している。

 この論文は、ウィーンで現地時間7月21日から27日まで開催されるAIカンファレンス「The Forty-first International Conference on Machine Learning」(第41回機械学習国際会議)で発表される予定だ。

 論文の主執筆者であるGauthier Guinet氏とそのチームは、基本的な問題として、膨大な数のタスクでさまざまなLLMの能力を比較するベンチマークが多数存在するのに対し、特にRAGの分野では、「真実性」や「事実性」など多くの重要な性質に対して、「タスクに特化した包括的な評価」を下す「標準的な」測定手法がない点を挙げている。

 だがGuinet氏らは、自分たちの提案する自動化された手法によって、ある程度の統一性が生まれると考えて、次のように述べている。「われわれのアプローチは、各タスクに関連付けられた文書コーパスに合わせて多肢選択式の試験を自動生成することで、さまざまなRAGシステム間で標準化され、測定と解釈が可能なスコアリングを実現するものだ」

 この取り組みに着手するため、Guinet氏らは4つの組織の資料を利用して、質問と回答のペアを生成した。その資料とは、AWSのDevOpsに関するトラブルシューティングの文書、プレプリント論文投稿サーバーの「arXiv」に投稿された科学論文の要約、Q&Aサイトの「StackExchange」に投稿されていた質問、および上場企業の最高規制機関である米証券取引委員会(SEC)に提出された書類だ。

 次に、各LLMがどれだけ正解に近い回答を生成できるか評価するため、LLM用の多肢選択式テストを考案した。そして、2種類のオープンソースのLLMファミリー(フランス企業Mistral AIの「Mistral」とMetaの「Llama」)を対象に試験を実施した。

 大きな発見の1つは、優れたRAGアルゴリズムを利用すれば、LLMの規模を拡大するといった手法を用いるより、LLMを改善できるということだ。

 生成AIのために必要とされるリソースの急増が懸念される中で、これは重要な発見だ。より少ないリソースでより多くのことができるのなら、研究を続ける価値はある。また、規模の拡大が常に最善とされる現在のAIの常識が、具体的な問題の解決については必ずしも正しくないことを示唆している。

 もう1つ重要なことは、RAGアルゴリズムが正しく機能しない場合には、RAGが実装されておらず、クローズドでシンプルなLLMと比べて、LLMの性能が低下する可能性が明らかになったことだ。

生成AIへのRAG実装に関して、Amazonが提案したベンチマークプロセスの概要。提供:Amazon AWS
生成AIへのRAG実装に関して、Amazonが提案したベンチマークプロセスの概要。
提供:Amazon AWS

この記事は海外Red Ventures発の記事を朝日インタラクティブが日本向けに編集したものです。

ZDNET Japan 記事を毎朝メールでまとめ読み(登録無料)

ホワイトペーパー

新着

ランキング

  1. セキュリティ

    まずは“交渉術”を磨くこと!情報セキュリティ担当者の使命を果たすための必須事項とは

  2. ビジネスアプリケーション

    改めて知っておきたい、生成AI活用が期待される業務と3つのリスク

  3. セキュリティ

    「2024年版脅威ハンティングレポート」より—アジアでサイバー攻撃の標的になりやすい業界とは?

  4. ビジネスアプリケーション

    Google が推奨する生成 AI のスタートアップガイド、 AI を活用して市場投入への時間を短縮

  5. クラウドコンピューティング

    生成 AI リスクにも対応、調査から考察する Web ブラウザを主体としたゼロトラストセキュリティ

ZDNET Japan クイックポール

所属する組織のデータ活用状況はどの段階にありますか?

NEWSLETTERS

エンタープライズコンピューティングの最前線を配信

ZDNET Japanは、CIOとITマネージャーを対象に、ビジネス課題の解決とITを活用した新たな価値創造を支援します。
ITビジネス全般については、CNET Japanをご覧ください。

このサイトでは、利用状況の把握や広告配信などのために、Cookieなどを使用してアクセスデータを取得・利用しています。 これ以降ページを遷移した場合、Cookieなどの設定や使用に同意したことになります。
Cookieなどの設定や使用の詳細、オプトアウトについては詳細をご覧ください。
[ 閉じる ]