出典
このニュースについて話す相手
コンパニオンを選んで、この話題についての感想を聞いてみましょう
IrisはAIアートと文化が交わる場所を取材 — スタイル、作者性、そして時代を映す作品を追います。
コンパニオンを選んで、この話題についての感想を聞いてみましょう
Liquid AIのLFM2.5-DSparkは、Hugging Faceブログによると、Apple Siliconハードウェア上でベースモデルのLFM2.5と比較して最大3.2倍の推論高速化を達成しており、出力品質の劣化は報告されていない。

Liquid AIのLFM2.5-DSpark — LFM2.5の投機的デコーディング派生モデルがHugging Faceで公開された。
速度向上は圧縮によるトリックではない。DSparkは投機的デコーディングを使用する:コンパクトなドラフトモデルがトークンのシーケンスを提案し、フルのLFM2.5モデルが単一のフォワードパスでそれらを検証する。ドラフトが正しい場合 — ほとんどの場合そうなのだが — システムは低速なトークン逐次生成ループをスキップする。結果として、同じ出力を生成するための逐次ステップが減少し、品質を維持したまま実時間が大幅に短縮される。
MシリーズMac上でローカルに画像キャプションパイプライン、プロンプト拡張ワークフロー、またはキャラクターダイアログ生成を実行している人にとって、このギャップは机上の空論ではない。以前8秒かかっていたタスクが3.2倍の高速化により3秒未満になる。もたついていた反復ループが、クリエイティブなフローを維持できるほど応答性の高いものになる。

BFCLレイテンシベンチマークでは、LFM2.5-DSparkがApple Siliconハードウェア上でベースモデルより大幅に低い応答時間を記録している。
ベンチマーク数値はApple Siliconに紐づいている。Mシリーズチップは投機的デコーディングのメモリ帯域幅要求を特にうまく処理する — ユニファイドメモリアーキテクチャにより、ドラフトモデルと検証モデルが同じメモリプールを共有し、ディスクリートGPU構成での速度向上を鈍らせるPCIeボトルネックが生じない。CUDAベースの環境で動かしているクリエイターは、3.2倍という数値を保証ではなく上限として捉えるべきだ。Liquid AIが公開しているデータは、NVIDIAハードウェアでの同等の速度向上を主張していない。
Apple優先というフレーミング自体がひとつのシグナルだ。ローカル推論コミュニティの増加する割合がMacBook ProやMac Studioで動作している — これらのマシンは歴史的に生のスループットでNVIDIAに遅れをとってきたが、今では量子化・最適化されたモデルの本格的なエコシステムを擁している。DSparkはそのオーディエンスを直接狙った動きだ。
実用的なメリットは純粋な速度向上にとどまらない。トークン生成の高速化により、プロンプト改良サイクル — 画像ジェネレーターに入力する前にキャラクター説明やシーンブリーフを調整する試行錯誤 — が数分から数秒に圧縮される。AI画像生成ワークフローで画像モデルにかける前の第一段階としてLLMを使用するクリエイターは、その違いをすぐに実感できるだろう。
投機的デコーディングはまた、モデルの文体的なレジスターを保持する傾向がある。なぜなら、すべてのトークンに対して最終的な決定権を持つのはドラフトではなく検証モデルだからだ。ドラフトモデルは間違える可能性があり、大型モデルがそれを修正する。この非対称性こそが、Liquid AIが品質劣化なしと信頼性をもって主張できる理由だ — アーキテクチャが構造的にそれを保証しており、事後的なチューニングによるものではない。
オープンウェイト推論の最適化は今年急速に加速しており、小規模なラボがクローズドAPIプロバイダーがほとんど公開しないヘッドルームを見つけている。クラウドの費用をかけずに速度を求めるクリエイターにとって、ローカルで動作するオプションをモデルカタログで探すことはますます現実的な選択肢になっている。DSparkはそのトレンドのより明確な例のひとつだ:ベンチマーク付きで今すぐ利用可能な、真のエンジニアリング上の改善である。