「高效推理」共找到 2495 篇相关文章
从自己出题到自己选题:耶鲁新方法让大模型 Self-Evolution 又进一步
本文解读了耶鲁、斯坦福等多机构联合提出的INFUSER大模型自进化新方法,针对现有方法仅以难度筛选训练数据的缺陷,提出用影响力分数筛选高价值训练题,实现双模型协同动态进化,实验验证效果显著。
LLM后训练太烧钱?清华&腾讯有了破解法门:关键是得会Rollout
大模型强化学习后训练中,rollout预算易成瓶颈,且并非所有rollout都有用。清华和腾讯研究者提出TRACE框架,将Agent轨迹视为树,分配预算给易产生“成功/失败对比”的节点,实验显示其效果良好。
TokenDance 首发上线 GLM-5.2,内测一周后今日正式开放
今日,TokenDance 平台首发接入智谱最新旗舰模型 GLM-5.2 并面向外部用户开放。它是面向开发者与企业的大模型聚合平台,用户接入一个 API Key 就能调用多种主流大模型。此前团队已对 GLM-5.2 深度内测与适配。
Mythos限测首日破防,论坛玩家猜网址就摸进门了
4月7日,Anthropic新模型Claude Mythos Preview限量发布,当天就有未授权用户猜出在线地址获得访问权限。Anthropic称未发现自身系统受影响,该模型对齐表现较好,但训练有技术错误。
千万养虾人的终极梦想!全球首个「养虾本」带你懒人养虾开箱即食
荣耀发布自研 YOYOClaw 龙虾技术,首发于 MagicBook 系列,开创「养虾本」品类。该技术预置龙虾能力,具备自主学习,节省 50% Token,有设备级防护,实现多端共享,推动 AI 产业范式转变。
晶圆级芯片和存算一体结合:中科院提出15万tokens/s晶圆级芯片方案丨ASPLOS'26
当前大模型发展对计算硬件需求增长,数据搬运成隐性开销。中科院团队成果Ouroboros实现晶圆级芯片,解决数据搬运问题,虽面临挑战,但性能与能效表现显著,验证了“存算一体+晶圆级集成”路线可行性。
目标更重要?国内公司超越Generalist,进化到动作中心世界模型
具身智能圈被Generalist CEO长文刷屏,其称目标比工具标签重要。但国内极佳世界未停于概念争辩,开源“以动作为中心的世界模型”GigaWorld - Policy,重构具身智能底层逻辑,在多方面表现出色。
AdaGen: 让图像生成模型学会自适应策略
当前主流图像生成模型多步策略依赖手工静态调度规则,存在需大量调参、无法适配样本特性的问题。本文提出AdaGen框架,通过强化学习训练策略网络,在四大生成范式上实现性能提升与效率优化。
阿里搞了个全能解析器,文档、图片、音频、视频一锅端
阿里巴巴开源 Logics-Parsing-Omni,用一个模型统一处理文档、图片、音频、视频四种模态,输出结构化 JSON 数据。它采用三级渐进解析框架,两阶段训练策略,在自建基准上多项指标超越 Gemini - 3 - Pro。
吴昊:AI 重构 SaaS,成本降百倍需求增千倍
SaaS市场经历‘惊魂六十天’,‘SaaS终结论’甚嚣尘上。但吴昊指出,AI让软件开发成本降100倍、需求增1000倍,会使行业洗牌,旧护城河崩塌,新壁垒出现,企业需转型。