シスコは、AIによるサイバーインシデントレポートが完璧に見えても真実として受け止めるべきではない理由を発見しました
Cisco Talosは、大規模言語モデル(LLM)がサイバーインシデントレポートを作成する精度を調査しています
Cisco Talos Incident Responseチームは、ChatGPT、Claude、およびGeminiなどの最新のLLMが技術的なサイバーインシデントレポートを生成できる信頼性を評価するテストを実施しました。結果は、最も「プロフェッショナルに見える」文書でさえ事実上の誤り、一貫性の欠如、および矛盾が含まれていることを示しています。
調査方法
* 準備 – 研究者は各モデルにインシデントに関する生のメモを渡し、レポート作成を依頼しました。
* 出力 – 3つのLLMすべてが視覚的に磨かれた文書を生成しましたが、詳細分析では不正確さと予期せぬ結論が明らかになりました。
Nate Pors(Cisco Talosのインシデントレスポンス部門長)は、企業ブログで結果を詳述しています。
LLMが「誤る」理由
Ciscoは問題をモデルの確率的性質に起因すると説明します。モデルは意味を理解するのではなく統計的重みから次の単語を予測します。Porsによれば、偏りは4つの方向で現れます:
1. データフラグメントの違い
各リクエストでモデルは入力の異なる部分に依存し、再現性と標準化された結果が得られません。
2. 一貫性のない結論
同じデータから異なる推奨が生まれることがあります。あるレポートでは組織全体でパスワードを強制変更する提案があり、別のレポートでは局所的な変更のみが示されます。モデルは最初に生成された推奨に固執しやすいです。
3. 非標準構造
LLMはトークンごとにテキストを形成するため、最終文書の構造とレイアウトが異なり、品質管理テンプレートが必要な環境では問題となります。
4. コンテキストウィンドウの問題
入力データ量がコンテキスト制限を超えると、モデルはセッション開始時の重要情報を「忘れ」、予測不能または混合結果を返す可能性があります。
サイバーセキュリティへの意味
Ciscoは理論的にはレポートの特定フラグメントにタスクを限定できると認めていますが、そのアプローチは時間節約を奪います。サイバー防御では小さな誤りでも高額になる可能性があります。そのため、最終文書の作成者は各単語を慎重に検証し、LLMの推奨に完全に依存しないようにする必要があります。
結論:大規模言語モデルは迅速にレポートを生成できますが、その出力は専門家による必須チェックが不可欠であり、サイバーインシデントの重要な文脈で誤りと不一致を回避するためです
コメント (0)
感想を共有してください。礼儀正しく、話題に沿ってお願いします。
コメントするにはログイン