发现商业评论 旗下
洞察商业 启迪未来

对话中昊芯英CEO:八年死磕TPU,国产芯片如何在算力新局中破浪前行

   时间:2026-07-29 18:53 来源:快讯作者:陈阳

在WAIC 2026展会上,中昊芯英凭借两项重要成果成为焦点:其第二代自研TPU架构AI芯片“须臾”首次亮相,同时联合杭州电信、中兴通讯打造的华东地区首个国产TPU千卡智算集群正式落地杭州。这一系列动作被媒体解读为“国产算力从实验室走向规模化应用的关键转折”。

作为国内少数掌握高性能TPU核心技术的企业,中昊芯英的芯片研发路径与主流GPU厂商形成鲜明对比。公司创始人杨龚轶凡在访谈中透露,早在2018年成立时,团队就判断基于Attention机制的Transformer架构将成为AGI的核心载体,因此将芯片架构设计聚焦于“大规模深度学习场景下的分布式并行运算”。这种战略选择使其在算力密度、功耗控制等维度形成差异化优势——新一代“须臾”芯片在混合精度算力达到896TFLOPS的同时,功耗较传统方案降低50%,且通过增加脉动阵列数量,将算力密度提升至行业领先水平。

杭州电信智算中心负责人王良从运营角度验证了TPU的技术特性:“在张量运算和推理任务中,TPU的能效比优势尤为明显。”这种特性在千卡集群场景下被进一步放大。据测算,同等规模下TPU集群的功耗仅为GPU集群的70%,且随着集群规模扩大,能耗差距呈指数级增长。这种优势使得中昊芯英的方案在智算中心建设中具备显著竞争力。

国产化程度是外界关注的另一焦点。杨龚轶凡明确表示,“须臾”芯片从指令集到计算平台实现100%自主开发,未采用任何外部数字IP授权。这种全栈自研模式虽然增加了研发难度,但确保了技术演进的自主性。不过他同时指出,硬件自主仅是基础,软件生态的成熟度才是决定产品竞争力的关键:“当前行业需要2-3年时间完善软件栈,使芯片性能得到充分释放。”

在商业化落地方面,中昊芯英采取“Token Factory”模式,通过标准化API服务降低客户使用门槛。这种策略已取得实质性进展:包括智谱、DeepSeek在内的主流国产大模型均能在其TPU平台上快速部署,且经过专项调优后,芯片算力利用率和模型吞吐性价比达到行业顶尖水平。杨龚轶凡透露,公司能在新模型发布当天完成基础适配,并在两周至一个月内将性能优化至最优状态。

随着Agent技术规模化应用,算力需求结构发生深刻变化。输入Token与输出Token的规模差距最高可达万倍,这对算力调度提出新要求——PD分离(Prefill-Decode分离)成为行业新标准。TPU架构因原生支持这种调度模式,在落地效率和成本控制方面展现出独特优势。杨龚轶凡解释道:“通用GPU需要兼顾全场景,而TPU从底层设计就针对这种分离调度优化,实施门槛更低且效率更高。”

然而,Token经济的爆发也带来新挑战。单Token价格持续下降与企业用量激增形成矛盾,导致总体算力投入不降反升。杨龚轶凡观察到,部分企业存在Token滥用现象:“有些应用场景完全不需要大模型,但为了追求技术时尚而过度消耗资源。”这种状况促使中昊芯英内部开始限制Token使用量,以引导客户聚焦真实生产需求。

这种“限流”措施背后折射出行业发展的深层矛盾:个体效率提升与组织效率变革存在时间差。杨龚轶凡以研发场景为例:“单个工程师效率可能提升5-10倍,但企业整体运营模式需要时间适应这种变化。”他认为,当组织架构能够匹配大模型发展节奏,当多数工作实现模型协同,才是Token经济真正成熟的标志。目前行业正处于这个转折点的前夜,供需双方的价值认同已初步建立,下一步需要解决的是效率匹配问题。

 
 
更多>同类内容
全站最新
热门内容