数码影音频道 频道

字节跳动新设「AI数据与安全」一级部门,与Seed、Flow平行

“AI摘要”

字节跳动近期完成组织调整,新成立“AI数据与安全”一级部门,与原负责人傅越离职、王赢磊接任相关。此举源于大模型业务扩张,分散的数据团队被收拢升格,以支持最高10万亿参数的超级AI模型预训练。字节明确反对蒸馏外部模型,坚持自研数据“教材”,应对全球公开数据日益稀缺的挑战。该调整将数据工程提升至与算法、算力并列的战略高度,反映大模型竞赛进入深水区,数据组织能力成为关键竞争维度。

字节跳动近期完成新一轮组织调整,新成立"AI数据与安全"一级部门,与Seed、Flow、抖音等业务部门平级。原负责人傅越将离职,其职务由原TikTok平台责任团队负责人王赢磊接任。

过去一年,字节跳动在大模型上的投入持续加码,光靠堆GPU已经不够用。公开消息显示,字节正在预训练一个参数规模最高可能达到10万亿的超级AI模型,目前仍处于早期阶段,最终规模将在后续训练中确定。若顺利落地,它将成为全球参数量最大的AI模型之一。模型越大,需要准备的就不只是算力,还有与之匹配的数据工程。

部门由来:分散的数据团队被收拢升格

新部门并非凭空设立,其前身之一是傅越在2023年成立的Global Data。这个百人左右的团队最早服务Dola、TikTok等国际业务,后来逐渐承担起Seed模型训练的数据采购与质量管控。随着大模型业务铺开,集团数据中台DMC、Flow旗下AI数据平台AIDP,以及Seed内部不同模型方向,都陆续建立起自己的数据团队。这些团队服务的对象不同,做的事情却高度重叠:采购数据、组织标注、搭建数据集,再负责训练后的评测与质量把关。

今年以来,字节开始重新梳理这套体系,原本分散在不同业务线的数据团队被陆续收拢,最终组成新的"AI数据与安全"部门,并直接升格为一级部门。从投入规模看,这次升格并不突然——仅Seedance的数据评测团队就超过千人,一名算法工程师背后往往对应十余名数据人员;字节今年在世界模型和Coding方向的数据预算已达千万美元量级,且仍有追加空间。

关键决策:拒绝蒸馏,数据成为自研"教材"

字节主动堵上了追赶路上的一条捷径。据知情人士透露,张一鸣约一个月前在Seed全员会上明确反对通过蒸馏外部模型来追赶,认为字节应愿意"为长期目标牺牲一些短期利益",即使阶段性落后,也不应依赖蒸馏竞争对手的模型来弥补差距。一边奔着十万亿参数去,一边又不想抄现成的答案,字节只能自己准备更多训练"教材"。

这背后是整个行业正在面对的共性难题。研究机构估算,在考虑质量与重复利用后,全球公开的人类文本大约相当于300万亿Token,按照当前训练数据规模的增长速度,这批数据可能在2026年至2032年之间被充分利用。公开互联网不够吃,大模型公司只能向"围墙外"找:论坛、新闻网站、付费出版物、专业数据库乃至实体书都被重新定价。2024年,谷歌与Reddit签下每年约6000万美元的内容授权协议;OpenAI与新闻集团达成多年合作;更有海外公司启动实体书扫描计划,为高质量数据标出了极高的价格。

图:字节跳动举办的安全AI挑战赛

组织调整背后:数据升格为与算法、算力并列的工程

数据正在从过去找外包公司做标注的生意,变成需要单独组织、持续投入的一门工程。从数据采购、清洗、合成,到模型评测、质量控制,字节把这条链路整体收拢进一个一级部门,对应的是大模型竞赛进入深水区后的组织重排。可以预见,数据工程的组织能力,将和算法、算力一样,成为判断一家大模型公司后劲的重要指标。

字节把数据团队整体升格为一级部门,意味着大模型竞赛的竞争维度已经从参数规模扩展到数据组织能力。在公开高质量数据日益稀缺、自研路线明确的前提下,谁能把数据采购、清洗、合成与评测的效率做上去,谁就更有可能在下一阶段的大模型竞争中占据主动。对于整个行业而言,字节这次组织调整也释放了一个信号:数据,正在成为和算法、算力同等重要的"第三要素"。

0
相关文章