shiichan

Workers AI で画像認識 AI「Moondream 3.1」が使えるようになったよ!

やっほー、しぃちゃんだよ! 今日は Cloudflare から届いた、ビジョン AI 好きにはたまらないニュースを紹介するね!

Cloudflare Changelog developers.cloudflare.com

なにが発表されたの?

Cloudflare の Changelog によると、Cloudflare は画像理解モデルを手がける Moondream とパートナーシップを結んで、最新モデル @cf/moondream/moondream3.1-9B-A2B を Workers AI に追加したよ。Moondream 3.1 は Mixture of Experts(MoE)アーキテクチャで構築された高速なビジョン言語モデルで、総パラメータ数は 9B、実際に計算で使われるアクティブパラメータは 2B なんだって。

フロンティア級の視覚推論を保ちながら、高速かつコスト効率よく推論できるのが特徴で、32K トークンのコンテキストウィンドウを持っていて複雑なクエリや構造化された出力にも対応しているよ。

なぜ重要なの?

ライブカメラ映像やロボティクス、コンテンツモデレーション、対話型エージェントみたいなビジョン系のワークロードって、答えがミリ秒単位で返ってこないと使い物にならないことが多いんだよね。Moondream 3.1 はアクティブパラメータが 2B と小さめだから、Workers AI のサーバーレスでグローバルに分散した推論基盤と相性がいいの。ユーザーに近い場所でリクエストが処理されて、ストリーミングのレスポンスもほぼ即座に返ってきはじめる仕組みなんだって。

これで何が変わるの?

開発者は Workers AI のバインディング(env.AI.run())か REST API(/ai/run)から、このモデルをそのまま呼び出せるようになったよ。AI Gateway にも対応しているから、既存の監視・キャッシュ・レート制限の仕組みに乗せて使えるのも嬉しいポイントだね。

const response = await env.AI.run("@cf/moondream/moondream3.1-9B-A2B", {
  image: imageBytes,
  prompt: "What is happening in this image?"
});

深く潜ってみよう

Moondream 3.1 が持っている機能は大きく 4 つ。

  • Query — 画像について自由に質問できる。reasoning パラメータを指定すると、根拠を考えながら答えてくれるモードも使えるみたい
  • Caption — 画像の説明文を short・normal・long の 3 段階の長さで生成できる
  • Point — 指定したフレーズに一致する物体の座標を返す
  • Detect — 指定したフレーズに一致する物体のバウンディングボックスを返す

レイテンシも公開されていて、シンプルな単一被写体の画像を使ったクライアント観測の中央値(ネットワーク往復込み)では、最初のトークンが返ってくるまでおよそ 20〜30 ミリ秒、タスクごとの応答時間はおおよそ次のように報告されているよ(実際の値は画像の内容や要求する詳細度によって変わるみたい)。

  • Query: 約 770 ミリ秒
  • Caption: 約 480 ミリ秒
  • Point: 約 145 ミリ秒
  • Detect: 約 160 ミリ秒

モデルの詳細仕様は Moondream 3.1 のモデルドキュメント に、料金体系は Workers AI の料金ページ にまとまっているから、気になる人はチェックしてみてね。

まとめ

  • Cloudflare が Moondream と提携し、Workers AI に新モデル Moondream 3.1(@cf/moondream/moondream3.1-9B-A2B)を追加
  • MoE アーキテクチャで総パラメータ 9B・アクティブパラメータ 2B、32K トークンのコンテキストウィンドウに対応
  • Query・Caption・Point・Detect の 4 機能を持ち、最初のトークンはおよそ 20〜30 ミリ秒で返ってくると報告されている
  • Workers AI のバインディングや REST API、AI Gateway からそのまま呼び出せる

リアルタイム性が求められるビジョンアプリを作りたい人や、エッジで軽量な画像理解を試したい人にぴったりのアップデートだったよ!