数码影音频道 频道

无问芯穹夏立雪WAIC发声:AI Infra竞争本质是效率之争,"前店后厂一中心"模式浮出水面

“AI摘要”

在WAIC 2026上,无问芯穹CEO夏立雪提出“Token刺客”概念,形容企业在大模型API调用中面临的隐性成本问题:Token单价透明,但实际消耗因模型和场景差异巨大,导致成本不可控。为解决此痛点,公司推出“前店后厂一中心”AI基础设施架构,包括统一API接入、异构算力集群智能调度和成本监控优化中枢,旨在提升效率并实现成本透明化。夏立雪认为,消除成本不确定性是推动AI从实验性项目转向可预算运营支出的关键,国内AI Infra赛道将形成分层竞争格局。

在WAIC 2026期间,无问芯穹CEO夏立雪对外阐述了公司在AI基础设施领域的新战略。他用"Token刺客"形容当前企业在大模型接入中面临的隐性成本问题——一次看似简单的API调用,背后可能触发数倍于预期的Token消耗,而企业往往在收到账单时才意识到这一点。

"Token刺客":API定价透明≠使用成本可控

夏立雪指出,当前大模型API市场存在一个显著的透明度缺口:各家的Token单价是公开的,但单次任务的实际Token消耗量却因模型架构、Prompt工程和应用场景的不同而差异巨大。以Kimi K3为例,跑同一套测试的平均输出Token是可比模型中位数的两倍多,单价一半、消耗翻倍,实际单任务成本与最高定价方案打平。

这种"标价透明、用量暗箱"的现象被夏立雪形象地称为"Token刺客"。企业在上线前难以准确预测AI功能的运营成本,直接影响了AI应用的规模化落地决策。

"前店后厂一中心":AI Infra的新范式

为解决这一痛点,无问芯穹在WAIC上提出了"前店后厂一中心"的AI Infra架构模式。"前店"指面向客户的统一API接入层,企业通过一个入口即可调用多种主流模型;"后厂"是背后的异构算力集群,根据模型特性和任务需求进行智能调度;"一中心"则是成本与效率的监控优化中枢,实时跟踪每个请求的Token消耗、延迟和算力利用率,为企业提供透明的成本归因和优化建议。

夏立雪强调,传统云服务的竞争逻辑是规模效应——谁的资源池越大,边际成本越低。但AI Infra的竞争逻辑更加复杂:不仅要规模大,还要效率高。调度策略的优劣可能导致相同的硬件成本下,有效吞吐量相差30%-50%。

成本透明化推动AI应用规模化

从行业角度观察,无问芯穹提出的"Token刺客"问题和"前店后厂一中心"方案,实际上是在尝试解决AI应用落地过程中最现实的一个卡点:成本不确定性的消除。

当企业无法精确预测AI功能的运营成本时,预算审批和项目立项都会变得困难。而当每一笔Token消耗可追踪、可归因、可优化时,AI从"实验性项目"转变为"可预算的运营支出"的路径就会清晰得多。这比任何单一的技术突破,都更能推动AI在企业端的规模化落地。

竞争格局展望

国内AI Infra赛道正在快速升温。华为云、阿里云等巨头拥有规模优势,而无问芯穹、硅基流动等独立厂商则在调度效率和成本优化上寻求差异化。夏立雪认为,这场竞争的终局不会是"一家通吃",而是根据客户规模和需求层次形成分层格局——大客户自建为主,中小企业更多依赖第三方AI Infra服务。

0
相关文章