时长控制」共找到 1599 篇相关文章

算法论文8

清华刘知远团队论文:最小化结构改动,短文本到文本丝滑升级 | ICLR 2026

大语言模型发展中,上下文度成关键瓶颈,主流架构计算开销大。清华刘知远团队提出《InfLLM-V2: Dense-Sparse Switchable Attention for Seamless Short-to-Long Adaptation》,提出可切换注意力框架,为上下文研究提供新思路。

AI科技评论
新闻资讯7

小扎AI复仇进行!OpenAI苏黎世办公室被端,650亿储备金狂烧不止

在AI模型发布趋缓,科技巨头掀起人才争夺战。Meta从OpenAI苏黎世分部挖走三位顶尖研究员,扎克伯格亲自出马抢人,AI巨头间人才竞争白热化,Meta今年还计划投入650亿美元推进AI野心。

新智元
算法论文7

模型宣称的“百万字处理能力”是真本事,还是营销噱头?LongCodeBench揭露真相

近年来大模型号称有百万字处理能力,但这是真本事还是噱头存疑。论文用LongCodeBench测评工具揭开上下文模型真实表现,测试顶尖模型发现文本能力‘翻车’,还分析了上下文难的原因及面临的瓶颈。

深度学习自然语言处理
产品应用7

OpenClaw 火了半年,Agent 执行层依然是工程空白

当前主流 Agent 工具链执行层基本空白,Violoop 是少数在执行层做系统化设计的项目。它是桌边触屏硬件,获取三类运行数据,具备感知 - 判断 - 执行运行,有多种核心能力,适合特定场景团队评估。

AI工程化
算法论文8

刚刚,OpenAI找到控制AI善恶的开关:ChatGPT坏人格在预训练阶段已成型

OpenAI最新论文揭示控制AI“善恶”开关。研究发现训练模型在某领域答错题,会致其在其他领域“学坏”,还找到“毒性人格特征”。同给出解决办法,能让模型恢复正常。

量子位
算法论文8

不止于量化:最新综述用「-空-构」三维视角解构KV Cache系统级优化

随着LLM向1M上下文演进,KV cache成推理服务效率核心瓶颈。墨尔本大学和华中科技大学研究者发布深度综述,用「间 - 空间 - 结构」视角梳理KV cache优化方法,还归纳关键观察、提出开放挑战,并整理了资源库。

机器之心
开源动态8

LLM文本内卷,谁是真英雄?告别跑分玄学,我们需要一把“公道秤”

OpenNLG Group做了统一上下文评估框架LOOM - Scope,兼容主流benchmark、model和上下文加速方法。该框架围绕BENCHMARK、DEPLOYMENT和EVALUATOR三大核心模块,还提出LOOM - Bench应对评估成本制约。

深度学习自然语言处理
推荐文章8

揭秘大模型Steering:从底层机理到系统评估,全面破解大模型行为控制之谜

近期《Science》研究表明可解析AI内部表征实现通用引导与监控。浙大联合阿里两篇ACL 2026主会论文,揭示Steering工作原理与能力边界,还开源一站式框架EasyEdit2,全面展示了Steering价值。

机器之心
算法论文8

不改模型也能提升推理性能?ICLR投稿提出测试扩展新范式OTV

ICLR 2026投稿论文提出单token验证(OTV),是测试扩展新机制,让模型能边推理边判断正误。它基于并行思考思路,借助轻量内部验证器分析推理过程,实验显示其性能优于主流方法。

量子位
算法论文8

除了prompting外,不动参数,如何改变模型行为?

文章指出传统提示工程控制大模型生成行为有缺陷,提出Steering Target Atoms (STA)方法。它用稀疏自编码器分解LLM高维表示,定位“原子知识组件”精准控行为,实验效果超现有技术,还能控制推理度。

深度学习自然语言处理