张一鸣给字节跳动指明了方向
上个月,久未露面的张一鸣出现在Seed全员会上,明确表示,字节做大模型“坚决不蒸馏”。在他看来,依赖蒸馏追赶,只会干扰真正的长期技术突破。
几天后,CEO梁汝波又在全员会上表明态度:字节会坚定自研大语言模型,先把基本功做好。哪怕暂时落后,也不能为了追赶打乱长期节奏。
两位核心人物先后发声,字节的态度已经很清楚。大模型这场仗,它不只要打,还要靠自己一步步打下去。
过去几年,字节先成立Seed做模型,又成立Flow做产品。如今,模型有了,产品也在加速落地,支撑两者的数据能力被提到了更高的位置。
近日,“智能涌现”从多个独立信源处获悉,字节跳动成立AI数据与安全部门。
据了解,新部门由王赢磊负责。此前,他曾担任TikTok平台责任负责人和TikTok直播负责人。
但截至发稿前,字节并未对上述情况作出回应。
从现有信息来看,字节此次调整并非简单增加一个部门,而是把此前分散在不同业务线的数据力量重新整合起来。
此前,AI数据相关工作分别由Global Data、集团数据中台DMC以及Flow旗下的AI数据平台AIDP等团队承担,彼此之间存在一定的职责重叠。
新部门成立后,这些团队被集中到同一套体系下,统一负责AI数据业务。
新部门的职责也不只是采购数据。从确定需要什么数据,到寻找来源、清洗加工,再到检查质量和安全合规,整个流程都被纳入管理。
更关键的是,新部门与Seed、Flow、抖音等部门平行。这意味着,数据不再只是模型研发背后的支持工作,而是被提升到了一级部门的位置。
这次调整并非突然发生。它是字节多年重组AI业务后,补上的又一块关键拼图。
回顾历史,字节对AI的布局,可以追溯到2016年成立的AI Lab。
AI Lab由前微软亚洲研究院常务副院长马维英负责,直接向张一鸣汇报。
在字节发展的早期阶段,AI Lab主要为内容产品提供技术支持。团队研发的推荐算法、视频特效等技术,后来被广泛应用于今日头条、抖音等核心产品。
这些技术不仅帮助抖音迅速成长,也让字节较早建立起自己的AI优势。
大模型浪潮兴起后,字节原有的AI组织已经难以覆盖模型研发、产品落地和数据供应等不同任务,公司由此开始重新搭建AI业务体系。
2023年,字节从AI Lab、AML和搜索等团队抽调人员,组建大模型研发部门Seed。按照不依赖蒸馏、不走技术捷径的思路,Seed仅自有数据标注团队就配备了近千人。
同年11月,字节成立AI应用部门Flow,专门负责面向C端的AI产品。随后一年,Flow陆续推出豆包、猫箱、豆包爱学等产品,逐步补齐字节在AI应用层的布局。
截至2023年底,Seed与Flow已经成为与抖音、TikTok、火山引擎等业务并列的一级部门。
2025年2月,原Google DeepMind副总裁吴永辉加入字节。
此后,字节围绕AI进行了一系列架构和人事调整,模型、产品、云服务和数据资源开始进一步集中。
前段时间,字节又将飞书团队拆分为两部分,产品团队并入豆包,销售团队划入火山引擎。
经过这轮调整,豆包接过了飞书积累的企业产品能力,火山引擎则获得了相应的客户和销售资源。豆包负责把AI产品做出来,火山引擎则负责把模型、算力和云服务卖给企业,两者的分工更加明确。
有媒体透露,张一鸣在与吴永辉共同召开的Seed全员会上解释过这次调整。字节整合火山引擎、飞书和豆包的资源,就是为了集中力量,建立算力和数据优势。
顺着这条思路往下看,AI数据与安全部门的成立便顺理成章。
当Seed、豆包和火山引擎同时提速,数据需求也会迅速增加。如果采购、标注、清洗和质检仍然分散在多个部门,不仅容易重复投入,也会拉长模型迭代的时间。
所以,字节需要一个独立部门,把分散的数据资源和处理流程统一管理。
而字节之所以急着补齐数据这一环,也与其不断加码AI模型和助手有关。
在2026年初全员会上,梁汝波将豆包及海外版Dola助手定为短期核心突破方向,提出要借助AI助手整合集团现有产品与服务;同时指出To B市场机会重大,火山引擎MaaS业务是字节模型能力对外商业化的重要载体。

图源:字节范儿
到了2026年年中全员会上,梁汝波对上半年AI业务做了复盘。他肯定了豆包在C端市场的表现,以及视频生成模型Seedance仍处于行业领先水平,但也坦承,基础大语言模型与海外头部产品之间确实存在差距。
也就是说,字节虽然在产品和商业化上跑得不慢,模型能力却仍然需要补课。
大模型的竞争日趋白热化。
不久前,月之暗面的Kimi K3和阿里巴巴的Qwen 3.8 Max在多项基准测试中表现抢眼,仅在部分能力上落后于Anthropic的Fable 5,也获得了不少国内外开发者的积极评价。

图源:Arena
对手不断推出新模型,字节必须加快迭代速度。但模型训练到了今天,已经不是单纯增加参数和算力就能解决问题。
另有消息称,字节正在探讨打造参数量超过5万亿的超级大模型,如果消息属实,这一规模将超过阿里和月之暗面目前已知的最大模型。
模型规模继续扩大,数据消耗也会随之增长。
火山引擎数据显示,截至2026年6月,豆包大模型日均Token调用量已超过180万亿,过去一年增幅逾10倍。

图源:火山引擎
商业化层面的进展同样可观。据IDC数据,火山引擎在中国公有云MaaS服务市场的份额已达49.5%,稳居行业第一。
在产品和商业化加速的同时,字节也在持续更新模型。
豆包大模型2.1 Pro重点提升了代码和办公能力,希望进一步进入程序开发、文档处理和企业协作等场景。
7月初发布的Seedance 2.5,则把单段视频生成长度提高到最高30秒,最多支持50个全模态素材联合输入,同时增加了更加灵活的视频编辑能力。
不过,业务越跑越快,对数据的要求也越高。
豆包每天承接大量用户需求,火山引擎要服务企业客户,Seed还要训练更强的模型。几条业务线同时提速,数据采购、标注、清洗和质检就不能继续各自为战。
或许正是为了应对这种规模级的挑战,字节才选择将数据能力集中管理,统一为模型训练提供充足的“弹药”。
总的来说,AI数据与安全部门成立后,字节围绕AI的分工进一步明确:Seed负责模型,豆包负责产品,火山引擎负责商业化,新部门负责数据和安全。
当然,新部门成立,并不意味着字节与领先模型之间的差距会立刻缩小。
多个团队整合之后,职责能否真正理顺,流程能否高效运转,数据质量能否得到提升,都需要时间检验。
但字节的方向已经很清楚。它既不想依靠蒸馏抄近路,也不满足于豆包积累的用户优势,而是准备把模型、产品、算力和数据这些底层能力重新做一遍。
不走捷径,就要把脚下的每一段路都修好。
2、电商号平台仅提供信息存储服务,如发现文章、图片等侵权行为,侵权责任由作者本人承担。
3、如对本稿件有异议或投诉,请联系:info@dsb.cn