无问芯穹夏立雪WAIC发声:AI Infra竞争本质是效率之争,"前店后厂一中心"模式浮出水面
在WAIC 2026期间,无问芯穹CEO夏立雪对外阐述了公司在AI基础设施领域的新战略。他用"Token刺客"形容当前企业在大模型接入中面临的隐性成本问题——一次看似简单的API调用,背后可能触发数倍于预期的Token消耗,而企业往往在收到账单时才意识到这一点。
"Token刺客":API定价透明≠使用成本可控
夏立雪指出,当前大模型API市场存在一个显著的透明度缺口:各家的Token单价是公开的,但单次任务的实际Token消耗量却因模型架构、Prompt工程和应用场景的不同而差异巨大。以Kimi K3为例,跑同一套测试的平均输出Token是可比模型中位数的两倍多,单价一半、消耗翻倍,实际单任务成本与最高定价方案打平。
这种"标价透明、用量暗箱"的现象被夏立雪形象地称为"Token刺客"。企业在上线前难以准确预测AI功能的运营成本,直接影响了AI应用的规模化落地决策。
"前店后厂一中心":AI Infra的新范式
为解决这一痛点,无问芯穹在WAIC上提出了"前店后厂一中心"的AI Infra架构模式。"前店"指面向客户的统一API接入层,企业通过一个入口即可调用多种主流模型;"后厂"是背后的异构算力集群,根据模型特性和任务需求进行智能调度;"一中心"则是成本与效率的监控优化中枢,实时跟踪每个请求的Token消耗、延迟和算力利用率,为企业提供透明的成本归因和优化建议。
夏立雪强调,传统云服务的竞争逻辑是规模效应——谁的资源池越大,边际成本越低。但AI Infra的竞争逻辑更加复杂:不仅要规模大,还要效率高。调度策略的优劣可能导致相同的硬件成本下,有效吞吐量相差30%-50%。
成本透明化推动AI应用规模化
从行业角度观察,无问芯穹提出的"Token刺客"问题和"前店后厂一中心"方案,实际上是在尝试解决AI应用落地过程中最现实的一个卡点:成本不确定性的消除。
当企业无法精确预测AI功能的运营成本时,预算审批和项目立项都会变得困难。而当每一笔Token消耗可追踪、可归因、可优化时,AI从"实验性项目"转变为"可预算的运营支出"的路径就会清晰得多。这比任何单一的技术突破,都更能推动AI在企业端的规模化落地。
竞争格局展望
国内AI Infra赛道正在快速升温。华为云、阿里云等巨头拥有规模优势,而无问芯穹、硅基流动等独立厂商则在调度效率和成本优化上寻求差异化。夏立雪认为,这场竞争的终局不会是"一家通吃",而是根据客户规模和需求层次形成分层格局——大客户自建为主,中小企业更多依赖第三方AI Infra服务。