多步聚合训练」共找到 5679 篇相关文章

算法论文8

大模型最后一层竟是推理累赘?绕开对齐税,奥数准确率暴涨 22.4%!

Qwen团队等最新研究打破传统认知,揭示‘对齐税’现象。提出置信解码策略,在架构、评测集上表现出色,能绕过‘对齐税’,提升推理准确率,且工程开销低,为大模型发展提供新思路。

量子位
新闻资讯7

Anthropic员工离职创业,估值10亿美元,也做「递归自我改进」

Anthropic离职员工Behnam Neyshabur和Harsh Mehta创立Mirendil公司,获2亿美元种子轮融资,估值达10亿美元。目标是构建工具平台,让科研团队自主训练AI模型,采用递归自我改进技术。

机器之心
推荐文章8

Anthropic揭秘Agent长线开发架构:引入GAN机制,Claude自主撸出全栈应用

Anthropic公开前端设计和自主软件工程最新突破,为让Claude构建完整应用,从GAN汲取灵感设计智能体协同架构。介绍架构实践、解决的问题及应用效果,还探讨架构简化和设计规律。

AI寒武纪
开源动态7

The Batch: 907 | 小而高效模型的“制作”方法

Mistral AI发布Ministral 3系列模型权重,结合剪枝与蒸馏技术,用级联蒸馏法构建。该系列参数规模有140亿、80亿和30亿,在部分测试中表现佳,训练成本低于传统方式。

DeeplearningAI
开源动态8

动态RAG新工作:效果爆了,代码已开源

大语言模型幻觉问题突出,现有动态RAG方法信号不可靠。QuCo-RAG从预训练语料库挖掘统计证据,用客观频率替代主观置信度,实现毫秒级幻觉检测与动态检索触发,代码已开源。

PaperAgent
新闻资讯7

提示词一响,烂片登场,OpenAI谈下200+迪士尼顶级IP出场费

迪士尼官宣向OpenAI投资10亿美元,签三年合作协议,授权Sora用旗下200个顶级IP生成短视频。此前好莱坞与AI版权纷争不断,如今迪士尼选择变现,但生成内容或影响其品牌形象。

机器之心
新闻资讯7

28岁印度裔创始人忽悠谷歌24亿!劈柴哥力推的王牌IDE,底裤被扒了个精光:“套壳”Windsurf,连Bug一起!

Google发布号称‘下一代agentic开发平台’的Antigravity IDE,开发者上手体验不佳。深入分析发现它像是Windsurf专有分支,界面、功能高度相似。其创始人称它是全新理念平台,但产品问题,安全性存风险。

AI前线
算法论文8

AEPO:智能体熵平衡策略优化,让探索更稳,推理更深!

中国人民大学与快手团队联合提出 AEPO 算法,解决熵驱动式智能体强化学习训练不稳等问题。它设计两项核心机制,在 14 个基准上优于主流算法,在 X 等平台获高关注。

机器之心
算法论文8

均值至上假繁荣!北大新作专挑难题,逼出AI模型真本事

当强化学习成大模型后训练核心工具,主流方法陷入「均值优化陷阱」,推理能力停滞。北大团队提出RiskPO,将风险规避理念融入优化目标,用MVaR+捆绑策略双管齐下,三大任务表现优异。

新智元
产品应用7

实测新版LiblibAI:终于把模型、生图、工作流塞进一个碗了

本文实测新版LiblibAI,它上线个模型,添加视频特效玩法。从“找模型”网站变为“AIGC流水线”平台,界面风格转变。虽有亮点,但也存在出图慢、模型惊喜感弱、页面卡顿等问题。

量子位