在WAIC 2026展会上,中昊芯英宣布了两项重要成果:其第二代自研TPU架构AI芯片“须臾”正式亮相,同时与杭州电信、中兴通讯合作建设的华东地区首个国产TPU千卡智算集群在杭州落地。这一系列动作被业内视为国产算力从实验室走向大规模商用的重要标志。
作为国内少数掌握高性能TPU核心技术的企业,中昊芯英的芯片研发路径与主流GPU路线形成鲜明对比。公司创始人杨龚轶凡在接受采访时表示,团队早在2018年成立时就判断,基于Attention机制的Transformer架构将成为AGI的核心载体。这一判断促使公司放弃通用GPU路线,转而专注开发专为大规模深度学习设计的TPU架构。"GPU架构为图形渲染而生,而TPU从设计之初就针对张量运算优化,这种专用性在AI时代成为关键优势。"杨龚轶凡解释道。
技术对比数据显示,TPU架构在算力密度和能效比上表现突出。相同模型计算能力下,TPU功耗仅为GPU的70%左右,且这一优势在集群规模扩大时呈指数级增长。杭州电信智算中心负责人王良指出,在实际运营中,TPU在推理任务中的表现尤为突出,其脉动阵列设计使张量运算效率显著高于通用GPU架构。
从"刹那"到"须臾",中昊芯英用八年时间完成两代芯片迭代。新一代芯片在保持功耗基本不变的前提下,性能提升达300%,混合精度算力达到896TFLOPS。更值得关注的是其国产化程度——从指令集到计算平台,所有核心IP均为自主开发,算子层面国产化率达100%。"我们没有购买任何数字IP授权,这确保了技术演进的完全自主权。"杨龚轶凡强调,当前国产大模型如智谱、DeepSeek等均已实现在其TPU架构上的快速适配。
随着Agent技术规模化应用,算力需求模式发生根本性转变。输入Token规模与输出Token的差距最高可达万倍,这对算力基础设施提出新要求——Prefill-Decode分离调度成为关键。TPU架构因其原生支持这种调度模式,在落地效率上较通用GPU具有明显优势。中兴通讯相关负责人透露,在杭州智算集群建设中,TPU的PD分离调度使资源利用率提升近40%。
然而,Token经济的爆发也带来新的挑战。单Token价格持续下降与企业用量暴增形成矛盾,导致总体算力投入不降反升。杨龚轶凡观察到,部分企业存在Token滥用现象:"有些应用场景完全不需要AI介入,但为了追求时髦仍在消耗大量Token。"这种状况促使中昊芯英开始在企业端实施Token使用限制,通过配额管理推动更理性的应用。
这种限制措施背后反映着更深层的产业逻辑。当企业开始主动控制Token消耗时,恰恰说明一线员工已真正认可AI工具的价值。杨龚轶凡分析称,目前存在个体效率与组织效率的"时差"——单个研发人员效率可能提升5-10倍,但企业整体效益提升存在滞后。只有当组织运作方式完成适应性改造,Token经济才能从粗放式增长转向精细化运营。











