“谁在带队,人才流向哪里。”
作者丨成妍菁
编辑丨胡敏
大模型竞争开始拼组织,这一次轮到字节。
8 月 19 日,据晚点 Late Post 报道,Seed 基础模型团队新设 Pretrain Data(预训练数据)、Horizon RL(强化学习)、Product Posttrain-Work(面向办公场景的产品后训练)和 Product Posttrain-Chat(面向对话场景的产品后训练)四个一级部门,分别由李成刚、唐晟宇、秦禹嘉、朱文佳等人负责,均向吴永辉汇报。
雷峰网了解到,四个新部门之下的分支架构与带队人选也已落定,而这些更细的调整,或许更能透露出此次组织变动背后的真实意图。
01
数据和RL开始集中
先看模型能力侧的两个部门。
有接近字节的人士称,Pretrain Data 由原先分散在文本、编程、视觉理解和语音方向的预训练数据团队合并而来,下设文本预训练(沈科)、代码预训练(Xia Xiao)、视觉预训练(林毅)和语音预训练四个分支,统一为 Omni 全模态模型和超大模型供给数据;
负责人李成刚是清华机械系本硕,曾从 0 到 1 搭建字节搜索系统,先后负责今日头条网页搜索和 TikTok 视频搜索的技术工作,其麾下沈科 2018 年从清华毕业后加入字节,是超大模型预训练数据的核心人物,Xia Xiao 则是开源代码模型 Seed-Coder 和定理证明搜索方法 BFS-prover 的核心作者之一。
相比数据条线,Horizon RL 的动作更大。Horizon RL 整合了分散在推理、视觉理解等方向的后训练团队,下设 RL Scaling(岳宇)、Reasoning(王明轩)和视觉强化学习(吴侑彬)三个分支,负责强化学习、提升模型的基础智能上限。
其中王明轩此前在火山翻译,北航本科、中科院计算所博士,曾在腾讯任高级研究员、多次拿下 WMT 机器翻译评测冠军,2019 年加入字节后一路做到大模型研究团队负责人,岳宇(Yu Yue)则是字节与清华 AIR 联合开源的强化学习系统 DAPO 的算法作者之一。
这条路线其实已经有技术积累。Seed 此前公开过 DAPO、VAPO 等强化学习工作,其中 VAPO 聚焦于推理模型的强化学习效率与稳定性;Seed 也持续把RL用于更长链路的推理和Agent能力。
把这几个人和三个方向放在一起,Horizon RL 的意图就比较清楚了。
它并不是简单把原来的“后训练团队”换了一个名字,而是在把 Reasoning、VLM 等不同方向中的 RL 能力进一步集中。
据晚点 LatePost 报道,Seed 在调整公告中称,此次调整旨在‘合并相似工作、减少 overlap,内聚在一起’。
上述人士告诉雷峰网,本轮调整后,文本、代码、视觉这些老方向也没有真的消失,只是换了一种管法。
以视觉为例:训练前的数据归 Pretrain Data 的林毅,训练后的强化学习归 Horizon RL 的吴侑彬,两人各属一个部门、互不隶属,但视觉的数据和强化学习本是一根链条,所以吴侑彬在视觉方向上还要同时向林毅汇报。
类似的安排还有两处:唐晟宇在执掌 Horizon RL 之外,同时管着代码预训练;此前主导多模态交互与世界模型的周畅同时管着视觉预训练。
02
Work 和 Chat 各司其职
再看产品侧的两个部门,由原先统一的应用后训练团队按用户任务一分为二。
Product Posttrain-Work 服务 B 端,下设 GUI(吴志勇)和由原有 Agent 办公团队合并而来的分支,负责 Agentic 模型的整合与发布,针对办公场景优化模型的 Agentic 能力,包括支持豆包和 Dola 的任务模式。
负责人秦禹嘉是四个新部门负责人中的 90 后,师从清华教授刘知远,曾是面壁智能核心成员、开源工具学习引擎 BMTools 的作者,2024 年 7 月才通过"Top Seed"人才计划加入字节,是 GUI 智能体 UI-TARS 的第一作者,两年升至一级部门负责人;GUI 分支负责人吴志勇,公开信息显示其曾参与 OS-Atlas、SeeClick 等 GUI 智能体开源工作。
原本由朱文佳负责的 Application 团队继续保留,并更名为 Product Posttrain-Chat,它与新成立的 Product Posttrain-Work 分别面向 C 端对话和办公任务,下设豆包和 Dola Chat 分支,负责人严林同时吸收了吴双志的原班人马,主要优化搜索问答、对话体验、个性化和安全等能力,同时控制推理成本。
严林是中科院计算所硕士,豆包大语言模型 Alignment 团队负责人,在公开信息中还担任豆包关联公司的法定代表人。
有知情人士称,吴双志则转往火山引擎,负责火山 API 支持,向吴迪汇报——吴迪同时掌管字节机器学习中台和火山引擎的算法团队。
一拆一合的逻辑背后,其实很有意思:过去大模型产品更多按模型能力来分,比如语言、视觉、代码;现在,则开始更多按用户要做什么来分。
比如 Chat 面向搜索、问答、对话等 C 端需求,Work 则更多面向办公场景和复杂任务,等于把 AI Coding 里已经积累的工具调用、电脑操作和复杂任务执行能力,进一步用到日常办公中。
从人员安排来看:Work 交给更熟悉 Agent 的年轻团队,Chat 则由在字节内部成长起来的严林负责,吴双志这样的后训练人才则更多流向火山。
接近字节的内部人士称,字节现在的定位看似已经清晰:豆包、Dola 负责短期做大用户规模;Work 押注新的 Agent 办公场景;火山则承担更长期的企业服务和模型商业化。
放到行业里,Seed 的这轮调整并不孤立:腾讯上月将混元的大语言模型部与多模态模型部合并为基础模型部,由姚顺雨统一负责;海外 Meta 的超级智能实验室也按模型、研究、产品、Infra 四块重组。
能够发现,模型开始向 Omni 发展后,不同模态之间的边界变得模糊;Reasoning 和 Agent 成为竞争重点后,RL 也不再只是某个模型的“后训练环节”。
而 Agent 也在拉近模型和产品之间的距离,模型不只是负责“理解和生成”,还要调用工具、执行任务,最终直接参与到产品和业务流程中。
本次 Seed 调整得更彻底:它换掉的是整套组织逻辑——不再按文本、代码、视觉各自为战,而是把这些能力打散,重新装进数据、强化学习和产品任务里。
框架已经搭起来了,接下来要看的,是这套组织方式能不能真正跑通。