同样一批芯片、同样一度电,最终能生成多少满足质量、时延和稳定性要求的Token(词元)。
计算、存储、网络、模型部署和任务调度,只要有一个环节卡住,昂贵的芯片仍可能低效空转。
中科类脑瞄准的,正是这段从资源到智能产出的转化过程,让同样的芯片、同样的电,产出更多、成本更低、质量更稳定的Token。
它将自己的体系称为“算电协同型Token工厂”,把异构芯片、模型、用户任务和电力放进同一套系统调度,用更少的资源产出更多有效Token。
算力是生产设备,电力只是原料,用户提交的提示词和任务进入Token生产线,模型负责完成智能转换。
传统IDC交付机柜、电力、网络和空间,云厂商提供算力实例与模型接口;中科类脑向上再走一层,即Token生产运营层,试图对Token的生产效率、成本和任务结果负责。
效能决定每颗芯片、每度电能生产多少Token;场景化则决定这些Token能够产生多大价值。
在常峰的规划里,效能和场景同样重要,集中研发资源解决效能问题,组织业务资源解决高价值场景问题,再把产生的高质量token结合业务场景,实现应用价值的最大化,目前已经在AI4S及能源领域形成了可规模化的商业闭环。
它统一纳管英伟达、昇腾等不同架构的算力,聚合模型API和Token服务,并连接企业私有算力池与公共资源池。
以平均30张、峰值100张芯片的需求为例,企业按日常负载自建,高峰缺口由平台补齐70张芯片,相当于获得了一条可以弹性扩缩的Token生产线。
据中科类脑介绍,截至目前平台已接入逾3000个算力节点,总规模超过5000P,累计服务超8万企业及科研用户。
后台则是公司与中国科大团队联合研发的决策大脑,负责电算Token一体化系统从监控、预测到调度、运营的闭环运转。
它提供的是一套跨域生产组织能力:在满足安全、时延和稳定性的前提下,把分散的算力与模型资源组合成可以持续高质量交付的Token。
中科类脑最核心的技术落在AI系统软件层:把算力资源、芯片、模型、电价和任务纳入同一套决策系统,基于电力条件对算力、模型和任务进行柔性调度。
这套系统被概括为“1+3”架构:一个决策大脑连接算力、Token和电力三个子系统,先匹配算力、模型与任务,再把电力信号加入全局优化。
第一步是监控,实时监测Token需求、集群负载、新能源的发电功率、电价以及每份算力的Token产出效率;
第二步是预测,判断未来15分钟、1小时甚至更长时间内绿电出力、电价和任务需求的变化;
对首Token时延敏感的实时任务留在原地;可排队、可断续的批处理任务,则可以转移到电价低谷时段异地运行。
因此,中科类脑为每种芯片配置了一个“包工头”式插件,调度层只负责分发任务,插件负责指挥同类芯片;
解决不同芯片“能否协同”之后,系统还要进一步拆解推理流水线,解决“怎样协同效率更高”。
在大模型推理中,系统还可以把Prefill和Decode拆开,并通过KV Cache迁移把两个阶段连接起来。
两阶段之间的KV Cache必须高效迁移,否则长上下文需要重算,时延和吞吐都会受影响。
高端芯片不必包办整条推理链,新旧芯片、国产芯片和海外芯片都能在同一座Token工厂中各司其职。
对长上下文任务,KV Cache相当于模型已读内容的“工作记忆”。让它随任务跨节点迁移,可以减少重算。
另外,训练作业跨集群调度还要同步检查点、优化器状态和数据进度,并控制任务中断时间。
整个跨三地调度的控制响应保持在200秒以内,跨域迁移成功率达到100%,能耗预测精度达到98%。
这次测试验证的不只是搬运:而是把异构适配、跨域迁移、长上下文KV跨节点协同、绿电预测和SLA约束放进同一条生产链联动,电力信号让任务按电网压力和绿电供给调整运行地点。
9月17日,皖疆人工智能科技产业园在乌鲁木齐正式开园。园区按照“三中心一平台”布局规划建设,首个突破千P的融合算力中心已经建成投运。
“算力、电力单看,我们可能都在第一梯队。但真正的壁垒不是单项能力,而是叠加之后的系统级能力。”
他进一步表示,异构调度和推理优化等算侧能力,也可以追赶,绿电出力预测等电侧能力,竞争对手可以补上;
真正困难的部分,是把两套技术语言、两批工程经验和两类运行数据装进同一个系统,并让它在真实业务中长期稳定运行。
针对这套核心壁垒,中科类脑进一步升级系统调度与运营能力,在刚刚结束的世界制造大会上,正式推出算电词元一体化平台。
平台是面向AI基础设施(Token工厂)推出的操作系统,延续“1+3”核心架构,以博弈智能决策大脑为中枢,打通算力、Token、电力三大子系统,构建“电-算-Token”全链路闭环。
未来数据中心建成后无需人工干预,算力智能体负责芯片适配、任务切分和KVCache协同搬运;电力智能体负责电价预测、绿电出力预测,控制储能充放电,再由一个控制中枢统筹整座工厂。
国家数据局披露,我国日均Token调用量从2024年初的1000亿增至2026年3月的140万亿,两年增长超过千倍。
据统计,部分主流模型API累计降价超过90%。量在暴涨,通用Token的利润却被迅速压薄。
第一层是算力与Token优化,通过异构调度与推理加速技术,提升每度电产出的有效Token数量;
第二层是算电协同增益,在算力优化的基础上叠加电力协同,进一步压低单位Token成本;
度电智能由此成为顶层结果指标,底层硬核仍由异构调度、KV迁移和任务编排引擎提供。
与此同时,公司成立9年,已经在电力智能化领域深耕七年多,变电站智能巡检覆盖十余省市、上百座站点,沉淀出新能源预测、储能和微网控制能力。
这一路径决定了它的技术定位:AI集群调度内核是可独立交付的底座,电力域是建立在底座之上的跨域增量。
如在科研场景,科研智能体可以串起读论文、实验设计、验证和论文生成,把通用Token组织成完整的科研工作流;
在能源场景,公司深耕多年的央国企市场存在天然的业务门槛,行业数据和业务理解本身就把大部分竞争者挡在门外。
前者提升Token的价值高点,后者形成难以复制的供给壁垒,让场景化Token获得区别于通用的定价空间。
行业竞争已经走过“有算力”“模型数量”“API价格”,正在第四级“系统效率”开战,第五级“场景结果”刚刚开始。
在AI Infra方面,中科类脑的技术坐标首先是异构调度与KV迁移,电力域再把优化边界向外延伸。
中科类脑把异构芯片、模型和任务装进同一套跨域融合体系,核算吞吐、时延、迁移稳定性和任务质量;
资本持续押注这个方向。中移基金2025年独家投资B轮,中车资本2026年领投数亿元B+轮,银杏谷、水木、启迪等跟投。
这些信号仍需规模化收入和长期运营验证,这恰恰说明竞争坐标正靠近中科类脑提前投入的位置。
Token需求越大、价格越低,能够同时调度芯片、模型、电和任务的生产控制层就越稀缺。
量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1