9月16日,字节跳动(以下简称“字节”)旗下火山引擎宣布豆包大模型Doubao-Seed-2.1-pro更新至0915版本,API全量上线火山方舟,豆包工作同步完成升级,TRAE亦已接入。
新版豆包2.1 Pro模型围绕企业生产级需求,把多模态编程(Multimodal Coding)能力推到国内领先水平,专业Agent任务交付更可靠、图像与视频推理的Token消耗较上一代下降超过30%、综合使用成本进一步下降。
多模态编程:生产级落地必经之路
新模型上线前一天,字节CEO梁汝波已在2026飞书未来无限大会上作出判断:Agent进入可用阶段后,Agent、模型、协作环境三者必须紧密融合,才能真正发挥价值。基于这一判断,字节将豆包、飞书、火山引擎三大力量整合,聚焦打造工作与生产力产品,并明确表态将加大企业市场投入,让智能更快地在组织里产生价值。
以企业使用逻辑来看,这一“铁三角”分工清晰:豆包工作提供智能核心,飞书作为协作平台承载企业上下文与工具,火山引擎则为有自建Agent需求的企业提供模型、算力和开发工具。此次豆包2.1 Pro的升级,正是这一战略在模型层的最新落地。
而要理解豆包2.1 Pro此次升级的意义,需要先看清一个被长期低估的事实,即真实工程中的知识,并不大量存在于文档之中。以传统企业的工作流程为例,核心系统的操作逻辑往往沉淀在资深员工的操作习惯里,产品需求散落在设计图、界面草稿和录屏演示中。
例如,一位工程师接手一套运行多年的ERP系统,拿到的可能只是一段录屏和几张随手画的草图。传统纯文本代码模型在这种场景下天然“缺一条腿”,它虽能读懂代码,却读不懂画在纸上的意图。多模态能力补上的,正是这条腿。
豆包2.1 Pro 0915版本的官方案例直观展示了这种变化。面对一套约28万行Java代码、几乎没有文档的ERP系统,模型仅凭一段录屏和几张草图,便读懂了系统架构,生成出符合业务需求的移动端页面,并将完整链路跑通。这里的挑战不在于“写代码”,而在于“看懂人的表达”。
换言之,编程交互界面正在逐渐从“人学习机器的语言”,如写代码、PRD、接口文档等,转向“机器看懂人的表达”,如读懂草图、录屏和屏幕上的演示等,这一路径中,多模态正在成为AI编程实现生产级落地的必修课。
此外,本轮升级中,最具说服力的验证来自一个大型开源游戏项目Luanti的仓库修复任务。Luanti拥有约38.7万行代码和1000个真实历史Issue。在执行期间将官方补丁提前隔离,模型调度多个子Agent连续运行近36小时,完成根因定位与跨文件修复,最终83%的任务达到了可合并的标准。“可合并标准”意味着代码质量通过了真实生产环境的审视,它能被其他工程师接受、合并并部署,也更契合前端网页设计、游戏开发、3D建模等真实交付需求。
其中,在3D场景构建方向,豆包2.1 Pro 0915版本模型能仅凭4张设计图,便分阶段还原出庭院场景的基础结构,再叠加水体、植被和镜头效果,最终构建出风雨霜雪的四季可交互动态3D场景,把静态设计图变成了一个可漫游的数字空间。
Agent交付更可靠:从“能用”到“可信”
火山引擎总裁谭待曾在6月的FORCE大会上指出,全球范围内第一个跨越Coding与Agent“质变点”的模型是Claude Opus 4.6,而豆包2.1 Pro已来到同样的位置。彼时的评测数据也提供了支撑:豆包2.1 Pro在Terminal Bench 2.1、SWE-Pro、SciCode等国际代码评测中进入全球第一梯队,在OSWorld、MobileWorld、MMMU-Pro等Agent与多模态评测中同样位居前列。
字节在多模态底层技术上的积累,为这次能力跃升提供了支撑。目前,豆包2.1系列模型在OSWorld、MobileWorld等智能体操作评测中跻身全球第一梯队,在MMMU-Pro、CharXiv-RQ等视觉理解榜单上同样位居全球前列。
与此同时,在图像、视频、音频创作领域,字节以Seed系列构建了完整矩阵:视频生成模型Seedance 2.5支持30秒直出、最多50个全模态素材联合生成,图像创作模型Seedream 5.0 Pro达到专业设计级,音频创作模型Seed-Audio 1.0可一条指令同时产出台词、音效与配乐。
豆包模型的能力跃升,其Agent能力也随之受益。
在通用Agent方向,豆包2.1 Pro 0915版本强化了证据溯源、权威信源检索、时效判断与数据核验能力,使幻觉显著减少,在金融投研、办公自动化等需要多轮调用工具、联网调研并产出长报告的场景里,研究方法与交付质量更接近专家水平。而在VLM方向,豆包2.1 Pro 0915版本的3D物体识别与密集图文文档解析能力增强,工程图纸的尺寸标注与公差符号、财报研报的表格提取与跨页脚注引用等处理精度显著提升。
一个典型演示是核验某车企财报中“巴西超级工厂15个月建成投产”的说法。在任务进程中,模型自主调度500多个子Agent检索1000多个网页,结合海事AIS滚装船航迹、当地岗位变化与卫星时序影像交叉比对,不采信单方通稿,最终将数百页英文财报核验为一份可回溯的尽调报告,每一环结论都能落到具体证据。
这种能力突破的意义在于,AI正在从“辅助工具”向“可信赖的生产力伙伴”演进。当模型能够在复杂长程任务中稳定推进、且每一个结论都有据可查时,企业才真正敢于将核心业务环节交由AI参与。
多模态卡位:加速商业化闭环
目前,全球主要大模型厂商都在加速抢占多模态编程的生产级落地窗口。瑞银证券在7月研报中指出,2026年下半年AI主题将围绕“词元ROI”展开,AI编程的潜在市场空间正从开发者工具转向面向知识工作者的通用生产力工具;多模态方面的进展可能被市场低估,中国模型在视频制作能力和变现上展现出早期领先优势。
这一进程中,成本始终是企业级AI落地绕不开的关键变量。谭待此前披露,截至2026年6月,豆包大模型日均Token调用量突破180万亿,一年增长超10倍;同时,豆包2.1 Pro每百万Tokens输入价格为6元、输出价格为30元,缓存命中价格仅1.2元,综合使用成本较Claude Opus 4.6降低近80%。
本次0915版本进一步优化了Token效率,图像推理和视频推理的Token消耗比之前版本减少30%以上,推理轮次和工具调用次数也有降低。这对于需要高频调用API的企业客户而言意义重大。东方证券(600958.SH)研报称,Coding和多模态已成为AI商业化闭环的两大确定性场景,头部的coding和多模态厂商ARR增速显著跑赢。
除此之外,与模型升级同步,搭载豆包AI手机助手的努比亚NaviX Ultra也于9月16日正式发售。中兴通讯(000063.SZ)终端事业部总裁倪飞此前透露,该机已获工信部入网许可,是全球首款AI智能体手机。用户可通过语音指令完成点咖啡、叫车、屏幕问答、本地数据检索等跨应用操作,AI助手可调用字节全系列产品,并已接入飞书妙记能力。
模型能力的多模态跃升、Agent交付的可靠性质变,以及终端硬件的同步落地,均是字节以“模型-平台-算力”的融合逻辑,推动AI从个人助手向企业生产力的系统性变革。同时,这也印证了梁汝波在演讲中的判断,“AI影响巨大,企业都希望借助AI发展而非被冲击,这需要工作方式的系统性变革,远不止使用一套工具系统就能实现”,指向的正是字节所行之路。
重要提示:本文著作权归财中社所有。未经允许,任何单位或个人不得在任何公开传播平台上使用本文内容;经允许进行转载或引用时,请注明来源。联系请发邮件至editor@caizhongshe.cn。