新华通讯社主管

首页 >> 正文

直面全球AI算力博弈:国产TPU标杆中昊芯英的“架构突围战”
2026-07-30 来源:经济参考网

全球AI算力博弈进入全新阶段。The Information称,科技巨头谷歌首次将自研TPU芯片从内部基础设施推向外部市场,大规模瞄准长期由英伟达GPU主导的新兴云服务商;与此同时,三星电子因2纳米工艺订单激增、工程人力承压,正考虑将谷歌第十代TPU(代号“冰鱼”)的I/O裸片后端设计外包。目前,TPU已吸引包括Anthropic、Meta、苹果、Citadel Securities以及Safe Superintelligence等企业使用,TPU赛道正成为AI算力博弈的新焦点。

TPU作为针对张量计算和AI工作负载深度优化的专用架构,通过优化计算单元维度与数据传输路径,在AI计算场景中展现出远高于传统通用架构的能效比与计算密度,是降低AI算力成本、提升模型迭代及智能体应用效率的关键路径,也是国产AI算力生态中极具战略价值的技术方向。在这一关键窗口期,作为国内最早投身TPU架构AI专用算力芯片研发、实现高性能TPU芯片规模化量产的企业之一,中昊芯英完成技术迭代,推出新一代全自研高性能TPU AI专用算力芯片“须臾®”,同步推出搭载“须臾®”芯片构建的软硬件一体化智算底座——泰则® 2.0 AI高性能智算平台。

性能架构全面革新,精准破解大模型产业痛点

过去,行业算力供给高度依赖海外通用GPU,通用架构冗余模块拉高推理能耗,底层指令集、算子库完全受制于人,政务、金融等关键行业存在严重数据安全隐患。中昊芯英锚定TPU专用算力赛道,打造差异化技术路线,填补国内量产级自研TPU空白,完善国产算力多元化布局,为国内大模型产业提供底层硬件底座。

基于“刹那®”三年规模化落地的实践经验,中昊芯英完成新一代芯片“须臾®”的全面架构革新,针对性解决超大模型、长上下文、海量词元交互场景下传统算力存在的访存延迟、能耗偏高、并行效率不足等痛点。单芯片混合精度浮点算力达896 TFLOPS,性能为上一代“刹那®”的3倍;8-bit推理算力达1792 TOPS,适配海量词元高并发推理场景。单芯片额定功耗仅600W,较算力性能持平的传统算力芯片功耗降低50%。依托多维张量计算单元与数据复用优化设计,执行同等AI任务时,“须臾®”的综合计算效能可达传统GPU架构的数倍。

“须臾®”原生支持Prefill-Decode分离推理架构,大幅提升KV Cache缓存命中率,削减历史上下文重复计算。扩容寄存器与大容量片上缓存,优化片间互联带宽,有效缓解存储墙瓶颈,让算力不再因“等数据”而闲置,充分匹配AI智能体时代算力新需求。

全栈自主技术闭环,构筑国产算力核心护城河

“须臾®”延续全自研TPU技术路线,芯片IP核、专属指令集、底层算子加速库、整机系统软件均实现完整自主研发,无海外核心技术依赖。公司核心技术已完整覆盖芯片设计、电路开发、编译工具、模型适配全链条。这一全栈能力意味着,中昊芯英从指令集到芯片架构走完了从0到1的全过程,不依赖任何海外IP授权。

经过长期技术深耕,公司已建成成熟完善的软硬件生态体系。软件端全面兼容PyTorch、vLLM、DeepSpeed等主流开发框架,适配市面上绝大多数国产大模型;硬件集群层面,自研低延迟片间互联协议,单超节点最高支持2048片“须臾®”芯片直联,可稳定支撑万亿参数大模型计算与多智能体高并发推理。相比通用GPU,TPU架构剔除冗余图形渲染单元,算力资源全部聚焦AI张量计算任务。基于“须臾®”打造的泰则®2.0智算平台,单位算力建设成本仅为海外高端产品的60%,在规模化商用场景中性价比优势显著,成为政企、运营商、云厂商降本增效的选择。

据高盛分析师预测,到2030年,全球Token消耗量将较2026年增长24倍,达到每月约120 quadrillion(120千万亿)tokens。海量词元交互、长时序智能体任务,对算力能效、并发承载能力提出更高要求,也让专用TPU算力的价值进一步凸显。目前,国内算力产业已形成GPU、ASIC、TPU三条技术路线同步攻坚、协同互补的发展格局。中昊芯英以TPU专用架构为突破口,持续迭代技术、完善算力体系,正在为筑牢国家算力安全防线、实现技术弯道超车提供一条差异化的突围路径。(华柏)

凡标注来源为“经济参考报”或“经济参考网”的所有文字、图片、音视频稿件,及电子杂志等数字媒体产品,版权均属《经济参考报》社有限责任公司,未经书面授权,不得以任何形式刊载、播放。

《经济参考报》社有限责任公司版权所有 本站所有新闻内容未经协议授权,禁止转载使用

新闻线索提供热线:010-63074375 63072334 报社地址:北京市宣武门西大街57号

JJCKB.CN 京ICP备2024066810号-1