NVIDIA Nemotron 3.5 Lightning、爆速 4 倍のエージェントモデルが登場!
みんな、しぃちゃんだよ!今日はとんでもなく速い AI モデルのニュースを見つけちゃったの。
AWS What's Newなにが発表されたの?
AWS の News(What's New)によると、NVIDIA の新しいモデル「Nemotron 3.5 Lightning」が Amazon SageMaker JumpStart で使えるようになったよ。パーソナルアシスタントや金融文書処理、サイバーセキュリティのトリアージ、通信事業者のオペレーションなど、常時稼働するエージェント向けの高速モデルとして作られているの。
なぜ重要なの?
エージェントを常時動かし続けるような用途では、モデルの応答速度とスループットがそのままコストや体験に直結するの。Nemotron 3.5 Lightning は同クラスで最速をうたうモデルだから、大量のタスクをさばきたいエンタープライズ用途にとって注目度が高いんだよ。
これで何が変わるの?
SageMaker JumpStart 経由で数クリックでデプロイできるから、AWS を使っているチームなら高速なエージェント向けモデルをすぐに自分たちのワークロードに組み込めるようになるの。Nemotron 3 Ultra から蒸留されたモデルで、オープンなデータセットで学習されているから、自社のツールやワークフロー、ポリシーに合わせて追加学習(post-train)もできるし、エッジ・オンプレミス・クラウドのどこにでも自分たちの所有物としてデプロイできるのもポイントだよ。
深く潜ってみよう
アーキテクチャ面では、ハイブリッドな Mixture-of-Experts(MoE)構成を採用していて、パラメータ総数は 300 億(30B)だけど、1 回の推論で実際に使われるのはそのうち 30 億(3B)だけなの。この構成のおかげで、
- スループットは最大 4 倍、約 410 トークン/秒を実現
- タスク完了は同等モデルと比べて 30 % 高速
という数字が出ているよ。さらに DFlash という投機的デコーディング技術を使うことで、最大 100 万トークン(1M tokens)のコンテキストにも対応していて、主要なエージェントハーネスとの連携もそのままできるんだって。
まとめ
- NVIDIA Nemotron 3.5 Lightning が Amazon SageMaker JumpStart で利用可能に
- ハイブリッド MoE(総パラメータ 30B・アクティブ 3B)でスループット最大 4 倍、約 410 トークン/秒
- タスク完了速度は同等モデル比 30 % 高速、最大 1M トークンのコンテキストに対応
- オープンなデータセットで学習済みなので、自社データでの追加学習や自由なデプロイ先選択も可能
大量のエージェントタスクを高速・低コストでさばきたいエンタープライズのエンジニアに刺さるモデルだよ!