在近期举办的 Seed 全员会议上,字节跳动创始人张一鸣明确表态,拒绝通过蒸馏技术追赶前沿大语言模型。他强调,公司应着眼于长远目标,即便需要牺牲部分短期利益也在所不惜。这一决策背后,折射出字节跳动在大模型竞争中的独特战略选择。
当前全球大模型竞争格局中,中国厂商表现亮眼。最新一期 Artificial Analysis 全球榜单显示,月之暗面 Kimi K3 Max 位列第二,阿里 Qwen 3.8 Max 排名第四,智谱 GLM 5.2 Max 和 DeepSeek V4 Flash 分列第七、第八位。相比之下,字节跳动的 Seed 2.1 Pro 仅排在第 21 位,与国内同行存在明显差距。这种反差引发业界对字节技术路线的深度探讨。
作为互联网头部企业,字节跳动在资源储备上具有显著优势:年利润规模领先行业,Seed 团队汇聚了搜广推体系培养的顶尖算法人才,全国布局的智算中心配备数万张 GPU 集群,抖音与 TikTok 构建的全球最大原生内容池更是独家数据资产。然而,这些优势并未直接转化为模型排名的提升,其根源在于公司坚持的技术发展路径。
据内部人士透露,字节跳动曾三次面临是否采用蒸馏技术的关键抉择。2025 年 1 月 DeepSeek-R1 发布后,内部首次出现跟进建议,但被张一鸣以"要学习人类思考方式而非模仿推理风格"为由拒绝;英伟达 Blackwell 芯片部署后算力差距扩大,公司选择投入 2000 亿元扩建智算中心而非采用蒸馏;Kimi K3 成功跻身全球顶尖模型带来的压力,也未能改变公司坚持自主训练的立场。这些决策通过 API 检测等技术手段严格执行,早在 2023 年 4 月就已禁止将 GPT 生成数据混入训练集。
技术层面,字节跳动的选择建立在对行业发展的深刻认知上。研究显示,反复使用 AI 生成数据训练会导致模型坍缩,尾部信息逐渐消失,最终引发能力退化。这种"近亲繁殖"效应在模型参数量越大时越显著,而真实世界的知识恰恰分布在长尾场景中。字节拥有的海量原生数据,虽然处理难度远高于合成数据,却能完整保留现实世界的复杂性,为模型提供更丰富的训练素材。
在多模态领域,词表自主权成为关键竞争点。使用他人词表意味着接受其语言偏好和认知颗粒度,这在处理中文成语、网络热梗等特色内容时会大幅降低效率。字节 Seed 系列聚焦原生多模态能力,其视频生成模型已实现 60 秒 2K 分辨率视频生成和 8 种语言唇形对齐。这种能力建立在自主定义的底层编码规则之上,包括视频帧的 Token 化粒度、音频节奏特征编码方式等核心技术环节。
硬件限制反而成为倒逼技术创新的契机。受美国芯片出口管制影响,字节只能使用性能受限的 H20 芯片,单卡训练效率与海外顶尖平台存在差距。这迫使公司通过扩大集群规模、提升资源利用率和极致工程优化来弥补差距。目前,字节已在内蒙古、山西、河北等地建成多个智算中心,形成数万张卡规模的分布式算力网络,2026 年 AI 基础设施资本开支超过 2000 亿元。
训练体系构建方面,字节跳动正在打造支撑超大规模模型训练的全栈工程能力。万卡级集群训练中,硬件故障概率随规模扩大呈指数级增长,这对故障检测、断点续训和容错恢复机制提出极高要求。公司自主研发的训练框架与基建能力,不仅解决了当前训练需求,更为未来参数规模持续攀升奠定基础。这种重工业级的系统能力,是采用蒸馏路线的厂商难以积累的技术壁垒。
据《金融时报》报道,字节跳动正在探讨训练参数规模达 10 万亿的大模型,远超国内同行现有水平。该项目由 Seed Foundation 负责人项亮主导,仍处于早期探索阶段。这一战略选择延续了公司"用规模换时间"的思路,试图通过量级跃迁直接触达下一个技术梯队。虽然面临数据供给、算力稳定性、推理成本等多重挑战,但全链路自研模型在知识产权合规性和全球化布局方面具有显著优势。











