模型 / Cosmos3-Super-Text2Image (nvidia)

Cosmos3-Super-Text2Image (nvidia)

文本生成高保真图像,面向物理AI与创作

作者 nvidia

仓库标识nvidia/Cosmos3-Super-Text2Image

显存未知许可 需自查任务 图像生成最近核对 2026-08-05
运行内存
权重格式未知,无法估算显存
运行时
VLLM
下载
139

Hugging Face 源仓库 ↗

快速上手示例

vllm serve nvidia/Cosmos3-Super-Text2Image (vLLM-Omni)

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
完备的推理接口(vLLM-Omni、Diffusers)可快速上手。
对位
开源替代Flux、SD3等文生图模型
适合
物理世界场景生成 / 文本到高保真图像创作
不适合
安全关键任务与精确物理模拟

独立证据与社区反馈

3 个独立来源 · 另 1 官方/转载最近验证 2026-08-05

基准测试表现出色,全面超越 BigBanana Pro,但 128GB+ 显存需求使得本地部署几乎不可行

  • 在 UniGenBench 上取得最高综合得分(91.36),语义一致性和英文文本渲染能力强
  • 以 agentic workflow 在 Artificial Analysis 文生图排行榜位列开源模型第一
  • 模型权重开源,允许商业和非商业使用
  • 本地部署需要 128GB+ 显存,单张 H100 80GB 都无法运行,本地部署基本不可行
  • NVIDIA 官方 API 仍在推进中,尚未正式上线

可信度NVIDIA发布,64B参数,支持vLLM-Omni/Diffusers,经GB200/H100推理验证

完整规格

规模
64B · 4k tokens (文本输入) · 权重格式未知,无法估算显存
授权
OpenMDW1.1 · 需自查
框架
vLLM-Omni / Diffusers / PyTorch
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 1.8k → 1.9k · likes +3

观测时间线