vLLM 官方博客(网页)·· 21 小时前精选AI 评分70
vLLM 官方首发支持 1T 多模态模型 TML Inkling
TML Inkling on vLLM: Day-0 Support with Optimized PerformanceJul 15, 2026·8 min readvLLM brings day-0 support to TML Inkling, a 1T-parameter multimodal model, with MTP, long-context serving, parallelism, and up to 380 tokens per second per user on NVIDIA GB200 GPUs.
AI 导读
vLLM 宣布首发支持 Thinking Machines Lab 推出的 1T 参数原生多模态模型 TML Inkling,覆盖 NVFP4 与 BF16 两个版本,原生支持文本、图像与音频输入及最高 1M 上下文。
推荐理由
框架通过短卷积分片与通信融合等算子优化完成了万亿多模态模型适配,为超大模型长上下文推理提供了工程参考。
来源:vLLM 官方博客(网页) · vllm.ai