出典
このニュースについて話す相手
コンパニオンを選んで、この話題についての感想を聞いてみましょう

TheoはAIニュースを、今夜すぐ試せるテクニックに変えます。
コンパニオンを選んで、この話題についての感想を聞いてみましょう
再帰的AIの自己改善——AIシステムがまもなく自らのコードを書き換え、独自のトレーニングデータを生成し、人間の介入をほとんど必要とせず超知性へと反復していくという考え——は、最も大胆な予測が想定していたよりも高い壁に直面していると、MIT Technology Reviewが報じている。
その約束は紙の上ではすっきりして聞こえる。AIがより優れたトレーニングデータを書き、より優れたバージョンの自分自身をトレーニングし、それがさらに優れたトレーニングデータを書く、という具合だ。しかし実際には、フィードバックはノイズが多い。モデルによって生成された合成データはそのモデルの盲点を引き継ぐ傾向があり、AIが自身を最適化するために書いたコードは、数回の反復後にしか表面化しない微妙なバグを導入することがある。MITテクノロジーレビューの分析は、この複合的なエラー問題を、研究者たちがまだ解決していない中心的な障害の一つとして描写している。
だからといって何も起きていないわけではない。LLMはすでにチップ設計のワークフローに貢献し、本番パイプラインで使用されるトレーニングセットを生成している。しかしそれらの貢献は監督されている——ミスが重大な結果をもたらすあらゆる段階で、人間がまだループの中にいる。AIが人間のチェックポイントなしに自らのエラーを検出・修正する完全自律的な再帰的改善は、出荷済みの機能ではなく、依然として研究上の問題である。

再帰的自己改善ループ:理論上は有望だが、実際には脆弱。
シーンパックをバッチレンダリングするキャラクターアーティストや、1日に何百ものバリエーションをプロンプトするコンセプトデザイナーにとって、実際的な問いはよりシンプルだ。モデルはいつ意味のある形で向上し、どれほど速く進化するのか?再帰的改善の仮説が成立していたなら、爆発的な能力の飛躍——毎月質的に異なると感じられる新しいモデル——を意味していただろう。
これらの知見を踏まえると、より可能性の高い軌跡は漸進的なものだ。アーキテクチャの改善、より優れたファインチューニングデータ(依然として人間がキュレーション)、そしてよりスマートな推論の最適化。それでも本物の進歩だ——今日の画像生成モデルと18ヶ月前のものとの品質の差は、使用する誰にでも見える——しかしそれは、一部の予測者が描写した非連続的な飛躍とは異なる種類の進歩だ。
どのモデルに時間を投資して学ぶかを決めるクリエイターにとって、これは実際に計算を単純化する。来四半期に自分自身を再発明するかもしれないシステムと競争しているわけではない。今日使用しているモデルカタログは進化するが、一夜にしてではない。現在のツールを中心に構築されたスキル——特定のスタイルパイプラインの習得、精密なプロンプトによる特定のアーキテクチャの操作の習得——は、誇大宣伝サイクルが示唆していたよりも長くその価値を保つ。
また、オープンウェイトのエコシステムにより大きな比重が置かれる。クローズドなフロンティアラボが近い将来に再帰的自己改善を解放しないとすれば、競争上の優位性は、慎重な人間監督のファインチューニングを行い、ウェイトを公開しているチームへと戻ってくる。Hugging Faceの中間年次オープンモデルレポートはまさにそのトレンドを記録した——オープンモデルが予想より速く品質の差を縮めている——そしてMITの分析は、再帰的改善のナラティブが許容していたよりも、その軌跡により長い滑走路を与えている。
MITの分析が浮かび上がらせる第二の障害がある。AIが書いたコードや合成データが優れていても、研究者たちは重い検証なしにそれをトレーニングにフィードバックすることに慎重だ。その慎重さは部分的に技術的であり、部分的に組織的なものだ。安全審査プロセスの構築に何年も費やしてきたラボは、モデルが自身の出力はクリーンだと主張するからといって、そのプロセスを迂回しようとはしない。
クリエイターにとって、その組織的な摩擦は静かに有用だ。使用しているモデルが、最も重要な段階で人間がループの中にいたことを意味する——これが、プロンプトとワークフローに関する/learnのガイドが依然として適用される理由の一部だ。基礎となるモデルの動作は、信頼できるテクニックを構築するのに十分なほど安定しており、自己改善の誇大宣伝が示唆していたよりも長くそのままであり続けるだろう。