マイクロソフトの研究者は、AIモデルがまだ複雑な課題を解決できないと主張しています

マイクロソフトの研究者は、AIモデルがまだ複雑な課題を解決できないと主張しています

19 hardware

Microsoftの研究者は、現在の大型言語モデル(LLM)が複雑な多段階タスクを実行する際に持つ制限を明らかにしました。

Microsoft Researchの実験では、最先端のAIモデルであっても、長時間にわたる多段階操作を任せられると重大なエラーが発生することが判明しました。テスト対象にはGemini 3.1 Pro、Claude 4.6 Opus、およびGPT 5.4が含まれ、平均して各モデルは自律的に処理した後で文書内容の約25%を失いました。

何をテストしたか
* ベンチマーク:DELEGATE‑52
フィリップ・ラバナ、トビアス・シュナベル、およびジェニファー・ネヴィルによって作成されました。これはプログラミングや楽譜記述から結晶学までの52の専門分野におけるワークフローをシミュレートします。

* 評価基準
モデルは、20回の処理サイクル後に文書の整合性をどれだけ保持できるかで評価されました。「完成度」の閾値は98%に設定されており、結果がそれ未満の場合、そのタスクは失敗とみなされました。

主な結論
| 分野 | 最良結果 | プログラミング | 強力なパフォーマンス | 自然言語 | 信頼性の低いモデル |
|------|----------|----------------|------------------------|-----------|---------------------|
| 品質低下 | 80%以上の文書組み合わせで品質が80%以下に低下。最良モデル(Gemini 3.1 Pro)は52分野中11分野のみ完成度基準を満たした。 |
| ジャンプエラー | 損失は徐々ではなく「ジャンプ」で発生し、1サイクルで10〜30%の精度損失が起こる。より高度なモデル(Gemini 3.1 Pro、Claude 4.6、GPT 5.4)は小さなエラーを回避しようとし、後続の段階に処理を遅らせて相互作用数を減らした。 |
| エージェント管理 | エージェントモードでツールを使用しても結果は改善されず、サイクル終了時には約6%品質が低下した。 |

ユーザーへの意味
研究者たちは、AIシステムに権限を委譲する際には依然として注意深く監視する必要があると強調しています。現在のモデルは狭い領域でのみ自律的に機能します。

しかしベンチマーク作成者は顕著な進歩も指摘しており、OpenAIのモデルファミリーは16か月で性能を14.7%から71.5%へ向上させました。これはLLMが継続的に発展していることを示していますが、複雑な多段階タスクではまだ制限があります。

コメント (0)

感想を共有してください。礼儀正しく、話題に沿ってお願いします。

まだコメントはありません。コメントを残して、あなたの意見を共有してください!

コメントを残すにはログインしてください。

コメントするにはログイン