ChatGPT、Gemini、およびClaudeはAIによる職業消滅の評価を分けており、科学者たちはその信頼性に疑問を抱いています
研究の核心アイデア
北西大学と米国大学の経済学者は、3つの主要な言語AIモデル(ChatGPT‑5、Gemini 2.5、Claude 4.5)が自動化リスクにある職業を評価する際に異なる見解を示すことを発見しました。これは、政策立案者や雇用主が将来の労働市場を計画する際に使用する「AI脆弱性指数」の信頼性を疑問視させます。
1. 研究方法
ステップ 内容
課題設定 モデルに職業のAIリスクを評価させる
回答比較 各モデルの評価を互いに、そして実データと照合する
差異分析 2つの主要因を特定:モデル自体の違いと既にAIを使用している専門家の影響
2. 結果
職業 | Claude 4.5 | Gemini 2.5 | ChatGPT‑5
会計士 | 高リスク | 低リスク | 中程度
広告マネージャー | — | 上位経営者 | —
* 意見の相違
- Claudeは会計士をトップに位置付け、Geminiは大幅に下げた。
- 広告マネージャーと上位経営者の評価も異なる。
- ChatGPTとGeminiは約75%で一致し、残りは約四分の一で差異。
* 「AIユーザー」の影響
金融アナリストはニューラルネットワークを積極的に使用し、将来モデルが学習するデータを生成している。これにより評価が偏り、すでにAIと密接に関わる職業がモデルの視点では脆弱性が高くなる。
3. 脆弱性指数の構築
1. 手動:専門家が特定タスクへのAI影響を評価。
2. ユーザー調査:プラットフォーム利用者の意見収集。
3. 大規模言語モデル(LLM):自動で評価生成。
* 問題点
- 手動は主観性に左右される。
- 調査は一つのプラットフォームに限定され、全市場を反映しない。
それでもこうした指数は分析レポート、コンサルティング、政策で広く利用されている。
4. 実務への意味
* 評価の信頼性は未確定で、LLMが専門家手法より正確かどうか不明。
* 単一指標に基づく意思決定リスク:政策立案者や雇用主が誤って単一数値に依存する可能性を警告。
5. 研究者の提言
1. 複数AIモデルを同時に使用し、単一モデルに頼らない。
2. 結果の不確実性レベルを明示的に提示。
3. 実際ユーザー調査で結論を裏付け、AI導入状況とタスク遂行を把握。
> 「個人的には仕事変更や専門選択の判断に一つの指標だけを頼らない方が良い」とミシェル・インは述べている。
結論:
現在のAI脆弱性指数はより批判的なアプローチを必要としている。複数モデルと実証データの組み合わせにより、予測を信頼性高くし、一方的評価に基づく誤った決定を回避できる。
コメント (0)
感想を共有してください。礼儀正しく、話題に沿ってお願いします。
コメントするにはログイン