powered by TechFeed
表示モード
主要ニュース

Liquid AIが「答えを生成しない」エッジ向けAIモデルをオープン公開 — 分類・検査タスクを1回の処理で完結、Jetson AGX Thor上で16ms応答

10月8日、Ryan Merketが「Liquid AI releases open d1 models for multimodal edge decisions」と題した記事を公開した。Liquid AIがリリースしたエッジ向けオープンウェイトモデル「d1」シリーズの最大の特徴は、テキスト・画像・音声の入力を受け取りながら、自然言語の回答を一切生成しない点にある。分類や検査といったタスクに対して1回のフォワードパスで構造化された決定を返す設計で、従来の生成モデルで必要だった「出力のパース」ステップそのものを不要にする。

10月8日、Ryan Merketが「Liquid AI releases open d1 models for multimodal edge decisions」と題した記事を公開した。Liquid AIがリリースしたエッジ向けオープンウェイトモデル「d1」シリーズの最大の特徴は、テキスト・画像・音声の入力を受け取りながら、自然言語の回答を一切生成しない点にある。分類や検査といったタスクに対して1回のフォワードパスで構造化された決定を返す設計で、従来の生成モデルで必要だった「出力のパース」ステップそのものを不要にする。


「回答を生成する」のではなく「決定を返す」モデル

Liquid AIが2026年10月7日、Hugging Face上でオープンウェイトモデル2種を公開した。**d1-3B(テキスト・画像対応)と、実験的なd1-omni-600M**(テキスト・画像・音声対応)だ。

このシリーズの設計思想は、一般的な生成モデルとは異なる。通常の大規模言語モデルは、サポートチケットの分類や画像の異常検知といった単純なタスクでもトークンを逐次生成する。これに対してd1は、入力状態を1回のフォワードパスで処理し、構造化された答えを返すアーキテクチャを採用している。出力形式はYes/No、ラベル選択、ルーブリックスコアの3種類で、パースが不要な機械可読な形式になっている。

エンジニアにとって実用的な意味合いは明確だ。ルーティング、検査、分類といったタスクで「文章を生成してからパースする」というステップを省けることになる。


2モデルの構成と違い

2モデルはベースアーキテクチャが異なる。

  • d1-3B:Liquid AI独自の視覚言語モデルLFM2.5-VL-3Bをベースに構築
  • d1-omni-600M:双方向エンコーダLFM2.5-Encoder-350Mに、視覚エンコーダと音声エンコーダを追加した構成。Liquid AIは「実験的」と位置づけており、開発継続中

なお、d1-omniについてはレイテンシの数値は公開されていない。


ベンチマークとレイテンシの数字

Liquid AIが自社レポートとして公開しているスコアは以下の通りだ。

  • Decision Index 0.2.1:d1-3Bが48.57。記載されている4Bモデル、9Bモデル、Decider 35B-A3B(47.11)を上回る
  • 7公開データセット平均:d1-3Bが82.9、d1-omni-600Mが78.4
  • 11公開画像ベンチマーク平均:d1-3Bが74.1(ベースモデルLFM2.5-VL-3Bの73.9を若干上回る)

音声に関するベンチマーク数値はない。Liquid AIは「音声決定のベンチマークはオープンな課題」と述べている。

レイテンシについては、NVIDIAのJetsonシリーズでの動作が報告されている。以下の数値はいずれもd1-3Bを単一問で計測した場合の値だ。

デバイス 1問あたりの応答時間
Jetson AGX Thor 16ms
Jetson AGX Orin 26ms
Jetson Orin Nano 50ms

Jetson AGX Thor上では3問を20msで処理したとも報告されている。ただしこれらはいずれもLiquid AI自身による計測値であり、ハードウェアやワークロードが異なる環境での再現性は別途検証が必要だ。

独立した検証として、HuggingFaceの別ベンチマークが9月30日に400ケース・2000決定でd1を評価し、精度0.742を報告している。ただしLiquid AI自身の7データセット比較とは条件が異なる。


ローカル実行とライセンスの注意点

モデルはHugging Face上でダウンロード可能で、Transformers経由でロードできる。なおLiquid AIはロード時にtrust_remote_code=Trueの有効化を指示している。

# Liquid AIの発表に含まれるコード例(概要)
model = AutoModelForCausalLM.from_pretrained(
    "LiquidAI/d1-3b",
    trust_remote_code=True
)

trust_remote_code=Trueは、Hugging Faceのリポジトリに含まれるカスタムコードをローカル環境で直接実行することを許可するオプションだ。モデルの挙動をリポジトリ側でコントロールできるため、実行前にリポジトリのソースコードを確認することが推奨される。セキュリティポリシーが厳しい本番環境では特に注意が必要で、Hugging Faceの公式ドキュメントにも同様の注意事項が記載されている。

ライセンスについては注意が必要で、リリースアナウンスに明示的な記載はない。両モデルのHugging Faceモデルカードには「LFM 1.0」のライセンスが記載されており、商用利用を検討する場合はその内容を確認する必要がある。

また、モデルのデモはSystem One Arcadeでも試せる。


背景:AMDが主導した2億5000万ドルの資金調達

Liquid AIは2023年創業で、CEOのRamin HasaniはMITのCSAILでポスドク研究員を務めた経歴を持つ。複雑系における意思決定が研究の中心だったことが、今回の決定モデルというコンセプトに直結している。

2024年12月にはAMDが主導する2億5000万ドルのシリーズAを調達。同調達はモデル開発とエッジ・オンプレミス製品の整備に充てられると発表されており、今回のd1リリースはそのロードマップに沿った動きといえる。

今回のオープンウェイトリリースは、10月5日に発表されたAPIホスト版d1の2日後に行われた。Liquid AIはAPIと並行してローカルデプロイ用のチェックポイントも提供していく方針を示している。


詳細はLiquid AI releases open d1 models for multimodal edge decisionsを参照していただきたい。