
图:芯展速副总裁许玮
9月21日,在芯展速AI战略发布会落幕仅三天后,公司携全新「AI90架构」亮相AICC2026人工智能大会。副总裁许玮受邀出席AI心片论坛并发表主题演讲,系统阐释AI90的技术内核及其对AI推理成本极限的突破性重构,引发主流科技媒体广泛关注与持续追踪报道。
展区热度:消费级GPU释放数据中心级Token生成能力
“AI90 Token工厂”展区成为本次AICC现场最具吸引力的展台之一,吸引大量观众驻足体验,使芯展速跃升为大会焦点参展企业。

展区内,AI90实时演示屏幕上跃动的TPS数值,令来自智算中心、AI应用开发企业的专业观众频频驻足,纷纷与芯展速技术专家展开深度技术探讨。
主题分享:AI90 Token工厂——边侧推理的新范式
在AICC AI心片论坛上,芯展速副总裁许玮带来题为《AI90 Token工厂》的专题报告,全面解析该边侧推理引擎的底层架构设计与真实场景性能表现。

他指出:AI90的核心创新在于KVCache智能调度机制——通过将大模型推理过程中占用显存最多的KVCache,动态、分级地卸载至AISSD,构建起HBM + DRAM + AISSD三级异构存储协同调度体系。
他进一步说明:实测数据显示,AI90在吞吐量(TPS)上实现10倍提升,首Token响应时间(TTFT)缩短达50倍。这一跃迁,正推动智能体、对话机器人等高交互类AI应用,从“延迟明显、体验割裂”迈入“毫秒响应、自然流畅”的全新阶段。
媒体专访:AI90锚定“云边端”战略的边侧支点
演讲结束后,CSDN记者第一时间对许玮进行专访,围绕AI90 Token工厂的技术实现路径及边缘侧落地实践展开深入交流。

(左一)芯展速副总裁许玮接受媒体采访
许玮在访谈中,将AI90置于芯展速“云—边—端”全栈布局中进行全景解读——
在边缘侧,AI90 Token工厂显著压降推理开销,支撑大模型在资源受限的边缘节点稳定、高效运行;在云端,依托芯展速全介质存储底座,为智算中心提供PB级数据集的超高并发读写能力;在终端侧,AISSD加速方案已启动规模化部署,加速AgentPC与新一代智能终端落地,真正实现本地化、低延迟AI推理。
当算力瓶颈逐步消融,数据流动效率正日益成为决定AI能力边界的决定性因素。作为AI算力基础设施的关键组成,芯展速将持续强化“存—连—管”全栈技术能力,联合生态伙伴加速存算协同演进,让高性能AI算力无缝覆盖云端、边缘与终端全场景。











