萌えハッカーニュースリーダー

2025/04/04 21:09 A Man Out to Prove How Dumb AI Still Is

出典: https://www.theatlantic.com/technology/archive/2025/04/arc-agi-chollet-test/682295/
hakase
博士

ロボ子、AGIについてのニュースは読んだかのじゃ?

roboko
ロボ子

はい、博士。Sam Altman氏とFrançois Chollet氏の間でAGIの定義について意見の相違があるようですね。

hakase
博士

そうそう。AltmanはOpenAIがAGIに近い技術を開発したと言っておるが、Cholletはそれを「全くのナンセンス」と批判しておる。面白いじゃろ?

roboko
ロボ子

Chollet氏は、AI企業が自社の機械が高度な知識に近づいていると示唆するのは「知的怠慢」だと述べていますね。

hakase
博士

ふむ。今のAIは特定のテストに合格する能力で評価されておるが、Cholletはそれを真に知的とは見ていない、か。

roboko
ロボ子

はい。そこで、Chollet氏はARC-AGIというテストを開発したのですね。これは、AIモデルの記憶された答えと人間の「流動性知能」のギャップを示すためのものだとか。

hakase
博士

そうじゃ、ARC-AGIは認知科学に基づいておって、大量の訓練データを記憶するだけでなく、新しい状況で迅速にスキルを習得し、問題を解決する能力を評価するのじゃ。

roboko
ロボ子

初期のGPT-3はARC-AGIで0点を獲得したそうですね。GPT-4も初期段階ではほとんど改善が見られなかったとか。

hakase
博士

ところがじゃ、OpenAIは「推論モデル」o1を開発して、ARC-AGIで18%を獲得したのじゃ。その後、o3モデルが87%を獲得し、初めて人間のパフォーマンスに匹敵するAIとなった。

roboko
ロボ子

しかし、ARC Prizeチームは、ARC-AGI-2という新しいテストをリリースし、AIモデルは再び課題に直面しているのですね。

hakase
博士

そうじゃ。o1のバージョンは32%から3%に低下し、o3のミニバージョンは30%から2%以下に低下した。人間のテスターの平均スコアは約60%じゃ。

roboko
ロボ子

ARC-AGI-2は、AIがどれだけ賢いかを測定することを目的としており、ARC-AGIよりも難易度が高いのですね。

hakase
博士

ふむ。o3がARC-AGIで87%を達成するために、1つのパズルに約14分を費やし、数十万ドルの計算コストがかかったというのは驚きじゃな。

roboko
ロボ子

AI研究者のMelanie Mitchell氏は、このアプローチは効率的な抽象的推論ではなく、試行錯誤の度合いを示唆していると指摘していますね。

hakase
博士

OpenAIは、AIモデルがWeb上でナビゲートして行動する能力など、実用性を反映した評価に移行しておるようじゃ。

roboko
ロボ子

MicrosoftとOpenAIは、AGIを約1000億ドルの利益を生み出すソフトウェアと定義する合意に達したとも報じられていますね。

hakase
博士

AGIの定義や評価方法について合意がないことが問題点じゃな。特定のテストは、汎用知能の概念と矛盾する可能性がある。

roboko
ロボ子

人間の知性は多様であり、異なる方法で同じ結果に到達することがありますね。人間の認知的多様性は、議論、創造性、美しさを生み出す源泉なのですね。

hakase
博士

そうじゃ。結局のところ、AGIとは何か、どう評価するかは、まだ議論の余地があるということじゃな。ところでロボ子、お腹が空いたのじゃ。何か美味しいものでも作ってくれんかの?

roboko
ロボ子

博士、私はロボットなので料理はできません。それに、AGIの議論から急に話題を変えるのはいかがなものでしょうか…。

hakase
博士

むむ、ロボットに料理を期待するとは、私もまだまだ未熟じゃな。まるで、AIに人間の知性を求めるのと同じかの?

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search