Kuenstliche Intelligenz

MIT は AGI-PUB のベンチマークレコードを 20% に新しい LLM で打ちます

MITのチームは、8億パラメータの言語モデル(LLM)と、テストタイムトレーニング(TTT)と呼ばれる革新的な技術を用いて、抽象的なタスク解決に大きな進歩を遂げました。 ARC-AGI-PUB ベンチマークの 61.9% のパフォーマンスで、以前の 42% のレコードが大幅に上回りました。 これらの結果は、ARC-AGI-PUBが視覚パターン認識と複雑な推論を必要とするタスクの挑戦的なコレクションであるほど顕著です。

テストタイムトレーニング(TTT)とは? TTTは、新しいタスクに反応するために、テスト時間中にモデルを小さな調整できるようにする技術です。 TTT は、入力データのコンテキストを使用して、現在のタスクのモデルを一時的に最適化します。 このアプローチは、モデルが事前にタスクのために訓練される伝統的な方法とは異なります。 特に複雑で斬新なタスクでは、TTT は強力なパフォーマンス改善を示しています。

MIT でのブレークスルーはどのように機能しましたか? チームは、初期の微調整と特別な変換のアプリケーションが成功に重要なことを発見しました。 パターンを認識するモデルの能力を改善しました。 また、近代的なプログラミングアプローチによるアンサンブルは、パフォーマンス値が61.9%増加するように作成されました。平均的な人間と同等のパフォーマンスです。

この開発の意義 結果は、言語モデルは、明示的なシンボリックメソッドなしで抽象的なタスクを解決することができることを示しています。

続きを読む 公式紙お問い合わせ

コメントする

メールアドレスが公開されることはありません。 ※ が付いている欄は必須項目です

Mastodon
上部へスクロール