在近日于无锡举办的2026中国计算机学会(CCF)芯片大会上,中国科学院计算技术研究所(以下简称计算所)孵化的智算创企“中科通量”正式对外发布全球首款数据流人工智能生成(AIGC)芯片——金刚GC3。
金刚GC3亮相CCF芯片大会。中科通量 供图
据介绍,这款芯片基于自研RISC-V数据流架构,面向视频全链路处理打造,搭载12核RISC-V核心,主频2.0GHz,单芯片AI算力达到200 TOPS(INT8)和32 TFLOPS(FP16),并配备128GB LPDDR5 ECC统一内存。在视频编解码能力上,它支持H.264/H.265硬件编解码,可实现128路1080P@30fps解码和64路编码。
“金刚GC3是在正确的时间节点,用最合适的架构做出的一款回答时代之问的精准产品。”中科通量总工程师罗鑫对《中国科学报》说,这不仅仅是一款新产品的问世,更是一次计算架构层面的系统性突破。
当前,文生视频、实时视频分析需求日盛。从云端长视频生成、直播实时智能渲染,到海量摄像头视频结构化、工业视觉质检、多目感知处理,视频数据处理占据了绝大部分的AI计算负载,是当前规模最大、增长速度最快的算力应用场景。正因此,一个不容忽视的结构性矛盾正在浮出水面:视频数据量呈指数级增长,但通用算力在视频处理场景下的效率提升却趋于瓶颈。
如何破解这一困局?中科通量给出了“数据流架构”的答案。
“用通用算力去处理专用场景,好比是‘大炮打蚊子’——既不够高效,也不够经济。”罗鑫告诉记者,当视频AI从锦上添花走向基础设施化,面向视频流式计算的领域专用架构芯片已是不可回避的选择。
他解释说,传统CPU/GPU遵循控制流模型,好比一位快递员走固定路线图依次送货,不仅需要在快递中心和派送区域间频繁搬运货物,而且每送完一单才能查看下一单地址。而数据流架构则完全摒弃了“程序计数器”和“固定指令序列”的概念,其运行遵循一个更简洁的规则:一条操作只有当其所有输入数据准备就绪时,才会被触发执行。
“这就像一座高度智能化的工厂流水线——每个工位(计算节点)在收到所有必要零件(输入数据)后立即开工,完成后自动将产品(输出数据)送到下一个需要它的工位,全程无需‘中央调度员’按顺序喊话。”罗鑫说,数据流架构被业界公认为解决“存储墙”与“能效墙”问题的重要探索方向之一,而视频智能——数据吞吐量大、并行度高、实时性要求强——恰恰是这一架构最能发挥优势的应用场域。
罗鑫介绍道,金刚GC3拥有200 TOPS的8位整数计算(INT8)算力和32 TFLOPS的16位浮点计算(FP16)算力,意味着这颗芯片在视频AI推理任务上具备与主流GPU同台竞技的峰值能力;而128路1080P实时解码的“硬能力”,则远超通用GPU在同等功耗下的视频处理密度。同时,128GB的统一内存与ECC纠错机制,更为大模型视频理解任务和大规模并发场景提供了存储保障。
具体到应用层面,罗鑫展望说,这颗芯片有望覆盖AIGC视频生成、智慧城市视频分析、工业生产视频感知等多个千亿级市场。
“尤其在大模型处理长视频、多模态理解等新兴场景中,数据流架构的低延迟与高吞吐特性将构成显著的差异化竞争力。”罗鑫说。
版权声明:凡本网注明“来源:中国科学报、科学网、科学新闻杂志”的所有作品,网站转载,请在正文上方注明来源和作者,且不得对内容作实质性改动;微信公众号、头条号等新媒体平台,转载请联系授权。邮箱:shouquan@stimes.cn。