模型 / Cosmos3-Super-Text2Image (nvidia)

Cosmos3-Super-Text2Image (nvidia)

文本生成高保真图像,面向物理AI与创作

作者 nvidia

~39GB 4-bit许可 需自查任务 图像生成最近核对 2026-07-19
格式
4-bit
文件
~34GB
运行内存
~39GB–50GB
运行时
VLLM
下载
139

Hugging Face 源仓库 ↗

快速上手示例

vllm serve nvidia/Cosmos3-Super-Text2Image (vLLM-Omni)

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
完备的推理接口(vLLM-Omni、Diffusers)可快速上手。
对位
开源替代Flux、SD3等文生图模型
适合
物理世界场景生成 / 文本到高保真图像创作
不适合
安全关键任务与精确物理模拟

独立证据与社区反馈

2 个独立来源最近验证 2026-07-19

社区普遍认可其为当前最强开源图文/视频生成模型,但指出其定位是物理AI世界模型而非消费级图像生成工具。

  • 在 Artificial Analysis 排行榜上取得开源图文生成模型排名第一
  • 在 Artificial Analysis 排行榜上取得开源图生视频模型排名第一
  • 提供 SOTA 级别的开源图像与视频生成能力
  • 模型定位为机器人与自动驾驶AI训练的世界模型,非消费级图像生成产品,与 Seedance 等消费级产品不构成直接竞争

可信度NVIDIA发布,64B参数,支持vLLM-Omni/Diffusers,经GB200/H100推理验证

完整规格

规模
64B · 4k tokens (文本输入) · 下载 ~34GB · 显存最低 ~39GB · 推荐 ~50GB · 4-bit(估算)
授权
OpenMDW1.1 · 需自查
框架
vLLM-Omni / Diffusers / PyTorch
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 28k → 27k · likes +24

观测时间线