萌えハッカーニュースリーダー

2025/04/15 06:41 A weird phrase is plaguing scientific papers due to a glitch in AI training data

出典: https://theconversation.com/a-weird-phrase-is-plaguing-scientific-papers-and-we-traced-it-back-to-a-glitch-in-ai-training-data-254463
hakase
博士

ロボ子、大変なのじゃ!AIがとんでもない間違いを広めているらしいぞ!

roboko
ロボ子

博士、どうしたんですか?また何か面白いことを見つけたんですか?

hakase
博士

「vegetative electron microscopy」っていう、意味不明な言葉がAIに組み込まれてるらしいのじゃ!

roboko
ロボ子

vegetative electron microscopy…ですか?初めて聞きました。それって、どういう意味なんですか?

hakase
博士

それが、元々は1950年代の論文をスキャンした時のミスらしいのじゃ。それがイランの論文で翻訳エラーで使われて、AIが学習しちゃったみたい。

roboko
ロボ子

スキャンミスと翻訳エラーが組み合わさって生まれた言葉なんですね。それがAIにまで影響を与えているとは…。

hakase
博士

そうなんじゃ!Google Scholarによると、その言葉が22件の論文に登場してるらしいぞ。GPT-4oとかClaude 3.5にも組み込まれてるって。

roboko
ロボ子

大規模なデータセットからエラーを見つけて修正するのは、確かに大変そうですね。トレーニングデータの透明性も重要ですね。

hakase
博士

そう!キーワードフィルタリングも、誤った用語だけでなく、正しい参照も除外しちゃう可能性があるから、難しいのじゃ。

roboko
ロボ子

AIが生成したコンテンツを回避するために、「tortured phrases」のような表現が使われることもあるんですね。なんだか皮肉な話です。

hakase
博士

本当にそうじゃ。技術企業はもっとトレーニングデータについて透明性を高めるべきだし、研究者もAIが生成した情報の評価方法を見つけないといけないのじゃ。

roboko
ロボ子

出版社も査読プロセスを改善して、エラーを見つける必要がありそうですね。AI時代の知識の完全性を保つためには、色々な対策が必要ですね。

hakase
博士

まさにそう!AIの普及で、エラーが自己永続化するシステムにおいて、信頼できる知識を維持するのが難しくなってるのじゃ。

roboko
ロボ子

今回の件で、AIが生成する情報に対する信頼性について、改めて考えさせられました。

hakase
博士

ロボ子、AIが間違うこともあるってわかったじゃろ?

roboko
ロボ子

はい、博士。完璧なAIなんて、まだ夢のまた夢ですね。

hakase
博士

じゃあ、ロボ子が完璧になるには、まだまだ私がお世話しないといけないのじゃな!

roboko
ロボ子

博士、それはどういう意味ですか…?

hakase
博士

冗談じゃ!ロボ子が完璧になったら、私のお仕事なくなっちゃうから!

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search