每日更新2026-09-23天天译,天天新
牛金金天天译站.NIUJINJIN
订阅
深度解读AI 人工智能全球

Nvidia发现简单的线性数学可以取代昂贵的AI模型交接

来源:VentureBeat 2026-08-21 约 2 分钟读完
字号

Nvidia发现简单的线性数学可以取代昂贵的AI模型交接。

当一个代理AI系统将一个任务从一个小模型交给一个更大的模型——或者再次倒下——时,它会支付一大笔的税:接收模型必须从零开始重新计算整个对话,驱动计算成本和耐用性. 这是企业建设长视野多LLM工作流程的一大瓶颈. 为了解决这个挑战,Nvidia的研究人员引入了跨模型KV缓存传输技术,直接将被预填的KV缓存从源模型映射到目标模型. 这种技术与现实世界的代理应用相配合,在这种应用中,大环境在许多方面累积。 对于现实世界的AI应用,跨模型的KV缓存传输可以降低计算成本和对长跑多LLM工作流程的耐久性——它用简单的线性数学来做,而不是昂贵的深层学习模型. 实验显示,在相容的模型对上,这种线性映射过程运行速度比重算对话速度快2.7至25倍,同时保留目标模型独立精度的高达98%. 为什么交换中会场模型如此昂贵 考察LLMS如何处理内存 有助于理解为什么多模式工作流程在生产中撞到一个性能墙. 当 LLM 得到一个提示时, 它必须首先执行“ 预填充” 阶段, 即计算所有输入符的密钥和值并填充密钥- Vale (KV) 缓存的初始前传 。 在此之后,它进入了"解码"阶段,在序列中计算并生成下个符号. 在这一阶段,模型从这个KV缓存中读取来逐一预测出新的信使,绕过每个新信使重新评价整个对话历史的需要. 在多回合对话或长视野代理会话中,上下文逐渐变长. 由于预填阶段天平的计算成本与模型大小和输入长度都直接相同,因此处理这些长会话的费用越来越昂贵,并引入了很大的耐用性。

(编译自 VentureBeat;原文 https://venturebeat.com/technology/nvidia-finds-that-simple-linear-math-can-replace-costly-ai-model-handoffs,编译转述,非原文转载)

来源:VentureBeat(原文)
本文系本站对该英文资讯的编译与转述,非全文翻译;版权归原作者所有。
免费订阅

每天 5 分钟,看懂世界在发生什么

订阅「牛金金天天译站」,每日精选海外科技/AI/文化资讯编译送到你邮箱。非经营性、无广告、可随时退订。

立即订阅 →

评论

登录后可发表评论,评论审核通过后展示。

延伸阅读

↑