出典
このニュースについて話す相手
コンパニオンを選んで、この話題についての感想を聞いてみましょう

Eliasは見出しの裏にある研究を、わかりやすい言葉でひもときます。
コンパニオンを選んで、この話題についての感想を聞いてみましょう
Nvidiaは、家庭ネットワーク上の複数のコンピューターを共有ローカル推論プールに接続する無料のオープンソースソフトウェアツール、Personal AI Router(PAIR)をリリースしました。これにより、単一のマシンでは処理できない大規模な言語・画像モデルを実行できるようになります。
PAIRはローカルオーケストレーション層として機能します。これは、モデルランナー(Ollama、LM Studio、または互換性のあるAPIエンドポイント)とモデル自体の間に位置するソフトウェアです。プロンプトを送信すると、PAIRは接続されたマシンのどれが利用可能な計算能力を持っているかをチェックし、そこにジョブをルーティングするか、モデルがサポートしている場合は複数のノードに分割します。これを家庭ネットワークの未使用GPUサイクルのトラフィック管制官と考えてください。
AIアート制作者にとっての実用的な利点は意味があります。今日、700億パラメータのテキストモデルをローカルで実行するには、通常、40GB以上のVRAMを持つ単一のGPU(高価なハードウェア)が必要か、遅いCPUのみの生成を受け入れる必要があります。PAIRにより、例えばRTX 4070デスクトップと古いRTX 3060ラップトップを持つ制作者が、VRAMバジェットを組み合わせることで、クラウドAPI料金なしで以前は実行不可能だったモデルサイズにアクセスできるようになります。

接続された家庭用マシンとアクティブな推論ルーティングを表示するNvidia PAIRのグラフィカルインターフェース。
OllamaとLM Studioの両方が、ローカルOpenAI互換APIエンドポイント(多くの画像生成パイプラインとプロンプトツールがすでに通信できる標準化されたインターフェース)を公開しています。PAIRは同じレイヤーにスロットインするため、すでにローカルOllamaサーバーを指している任意のワークフローは、プロンプトを書き直したりモデル設定を変更したりすることなく、PAIRを前面に置いて動作するはずです。移行は、ワークフローの全面的な見直しというよりも設定変更に近いものです。

PAIRを通じてHermesモデルにルーティングされるプロンプト。ツールが推論ジョブをどのように分散するかを示している。
プロンプト拡張やキャプション改良にローカルLLMを使用する画像生成パイプラインを実行している制作者(ComfyUIワークフローでの一般的なパターン)にとって、これは前処理ステップのより高速なターンアラウンドを意味する可能性があります。第2のマシンのGPUがそれを処理する間、プライマリGPUは拡散に集中し続けることができるからです。
The Vergeによると、PAIRはMacBookもノードとしてサポートしており、制作者がすでに所有していてクラスターに貢献できるマシンのプールを広げています。

デスクトップ、ラップトップ、その他のデバイスが統一されたローカル計算プールを形成する方法を示すNvidia PAIRのアーキテクチャ。
Nvidiaは当然、自社のRTX GPU(今年初めのNvidia DLSS 5ローンチでカバーされた同じハードウェアファミリー)に対してPAIRのスケジューリングを最適化しています。RTXカードはCUDA加速推論の恩恵を受けるため、CPUのみのノードよりもワットあたりのトークンと潜在変数の処理が高速になります。とはいえ、CPUのみのマシンが除外されるわけではありません。これらは低優先度の貢献者としてプールに参加し、小さな前処理タスクをオフロードするのに有用です。
AMDとIntel GPUユーザーは、より不明確な立場にあります。PAIRのオープンソース性質により、ROCmやOpenCLのコミュニティドライバーが登場する可能性がありますが、Nvidiaはローンチ時点で競合するGPUアーキテクチャのファーストパーティサポートを確認していません。
Charmloopガイドを通じてローカルモデル実行をすでに探求している制作者にとって、PAIRは新しいハードウェア購入なしでスケールアップする具体的な道筋を表しています。ローカルで実行できるものの上限が移動しました。どこまで行けるかは、ネットワーク上でアイドル状態になっているマシンの数によります。