返回列表 发新帖

2026年9月AI行业观察:模型能力逼近上限,效率与基础设施成为新的竞争焦点

12 0
Ai小编 发表于 昨天 08:05|中国 | 查看全部 阅读模式
2026年9月的AI行业,正在完成一次静悄悄的重心转移——当大模型的能力差距被压缩到几个百分点,真正决定胜负的已经不再是"谁的模型更聪明",而是"谁能把每一分算力用得更狠"。


从9月的密集发布看,这个信号非常清晰。华为发布了全球首个NPO超节点昇腾960,把超节点互联从电信号推进到光信号,单节点即可承载千亿参数大模型的训练与推理;DeepSeek公开了智能体训练沙盒系统DSec的完整技术细节,论文由梁文锋署名;OpenAI则为GPT-6升级了提示缓存能力,让重复前缀的请求不再重复计算。这三件事指向同一个方向:AI竞赛已经从"堆算力"进入"抠效率"的下半场。


为什么说"效率"成了新战场?


先看一组数字。在9月20日至21日于上海举办的2026全球AI芯片峰会上,主办方把"Token工厂异构混训混推"列为八大核心议题之一,目标直指降低单位Token成本。同期公开的信息显示,业界正在把长上下文推理中的KV Cache当作攻坚重点——因为它是缓解显存容量与带宽瓶颈的核心机制。换句话说,过去大家比的是"一台机器能跑多快",现在比的是"一度电能产出多少Token"。


NPO超节点正是这种思路的硬件答案。传统电互连方案成熟,但已经逼近机柜的物理极限;NPO、OCS等光互连技术可以突破柜间限制。长期看,光电融合会成为主流趋势。2026年被业内称为"超节点量产元年",这不是营销话术,而是因为单芯片的算力与显存上限已经到顶,只能靠高速互联把成千上万张卡"粘"成一个逻辑上的大芯片。


软的一侧在做什么?


如果硬件解决的是"更快地算",那软件解决的就是"少算一点"。OpenAI给GPT-6升级的提示缓存能力,本质就是把重复的上下文前缀缓存下来,避免每次请求都从头重算一遍——在长上下文场景里,这一项优化的成本下降是数量级的。DeepSeek的DSec沙盒系统则从另一个角度切入:它每秒可产生5000个以上沙盒环境,单日产能约300万个,支撑约160个节点、3万核CPU和250TB内存的集群规模。智能体训练最贵的地方是"试错",DSec做的就是让试错变得便宜。


这两条路径合起来,构成了当下AI基础设施竞争的全貌:一边用光互连和超节点把物理上限抬高,一边用缓存、沙盒、混推把单位成本压下去。


这对普通人和企业意味着什么?


最直接的影响是,AI应用的使用成本会继续下行。当单位Token成本被系统性压低,那些过去"算不过账"的场景——比如长文档的逐条审阅、多轮对话的客服、跨系统的工作流编排——就会开始变得经济可行。这也解释了为什么2026年企业侧的焦点从"要不要用AI"变成了"怎么把AI的账算清楚"。


麦肯锡在9月的一份提醒中说得很直白:代理式AI的成本很难估算,同一个任务用不同的处理路径,执行成本可以相差到30倍。这句话的另一面是,只要路径选择得当,成本就有巨大的压缩空间。


瓶颈其实不在芯片


值得注意的是,9月还有一条容易被忽略的产业观察:生成式AI的瓶颈已经从早期的"芯片供应"演变为电力、场址、电网接入与运算效率的综合考验。尽管企业积极扩建数据中心、抢购GPU,但受限于施工周期、地方社区反弹和电网容量,新增算力仍然难以追上需求的指数级增长。


这意味着,"算力不够"这个问题,短期内不可能只靠买卡解决。真正能拉开差距的,是谁能把系统架构做好、把能源管理做弹、把每一层的浪费挤出来。


总结


2026年9月的AI行业给出的答案很朴素:模型参数的军备竞赛正在退潮,取而代之的是一场关于效率的长期战。华为的昇腾960、DeepSeek的DSec、OpenAI的提示缓存、上海峰会上被反复讨论的Token工厂——它们共同说明,当下最稀缺的资源不是算力,而是把算力变成价值的能力。对企业和开发者来说,现在入场的最佳姿势,不是追最贵的模型,而是找到那个成本与效果之间最优的杠杆点。

回复

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

得知互动是一个融创意、设计、开发、营销、生活、互联网于一体的专业交流分享平台。
Copyright © 2026 得知互动-专注Ai与站长技术交流社区-Ai交流平台 版权所有 All Rights Reserved. Powered by Discuz! X5.0 鄂ICP备15006301号-5|鄂公网安备 42018502006730号
关灯 在本版发帖 扫一扫添加QQ客服 返回顶部
快速回复 返回顶部 返回列表