「验证不对称性」共找到 2070 篇相关文章
AI哪怕答案正确,逻辑链却惨不忍睹,奥数级不等式证明成功率不到50%| 斯坦福&伯克利&MIT
斯坦福、伯克利、MIT等联合研究,系统评估29个大模型在奥数级不等式证明任务的能力。研究发现,模型答案正确多靠猜,推理漏洞多,参数大、思考久也不能提升推理严谨度,但自我反思和定理线索策略有改善效果。
何恺明改进了谢赛宁的REPA:极大简化但性能依旧强悍
扩散生成模型在建模复杂数据分布表现出色,但与表征学习领域关联不大。谢赛宁团队提出REPA,不过较麻烦。何恺明团队提出Dispersive Loss,简化且性能强,无需预训练等,适用于多种模型。
揭秘LLM“思考”之谜:推理即“梯度下降”,元学习框架解构训练过程,还给优化提供新思路
上海AI Lab团队提出RaML框架,从梯度下降和元学习角度揭示LLM“思考”机制。通过实证验证推理轨迹作为参数更新的合理性,还对比不同训练策略,指出RaML为优化LLM性能提供新思路。
训练MoE足足提速70%!华为只用了3招
Scaling Law下,MoE成扩展模型能力法宝,但训练难题凸显。华为构建Adaptive Pipe & EDPB优化方案,还打造DeployMind仿真平台,解决了MoE训练中通信等待、负载不均等问题,使训练吞吐提升72.6%。
LLM+RL遭严重质疑,随机/错误等虚假奖励也能提升至标准效果?
论文在AI领域观察到类似随机给糖或奖励错误答案让孩子成绩提升的现象,‘虚假奖励四大奇招’效果接近用标准答案训练,Qwen2.5 - Math - 7B模型在测试集上性能飙升,还揭示了Qwen特别的原因及随机奖励有效的推手。
LLM加RL遭质疑:故意用错奖励,数学基准也显著提升,AI圈炸了
华盛顿大学等机构论文引爆AI界,其发现用虚假奖励训练Qwen2.5-Math-7B模型,也能提高MATH - 500成绩。虚假奖励对Qwen模型有效,但在其他模型上有限,凸显RLVR有效性与模型能力有关。
甲小姐对话柳钢:AI编程商业化的中国解法 | 甲子光年
AI编程赛道发展火热但商业化难题凸显,国内外市场境遇不同。极狐GitLab CEO柳钢将困境转化为突破口,推出驭码CodeRider。他认为用AI赚钱时代已到,还分享对产品、商业、开源等方面的看法。
OpenAI发布GPT‑6 Astra:百万级上下文,主攻编程和复杂办公
9月3日,OpenAI发布GPT - 6 Astra,重点提升电脑操作、软件开发和复杂工作处理能力。它有诸多更新,如电脑操作提速、支持异步工具调用等,但也存在监测难、价格高的问题,实际效果待验证。
从1000通到1.5万通,百融智能的「硅基客服」真正开始「上岗」
今年7月,一家头部物流企业和大型综合类头部券商上线百融智能的AI客服,业务量和部署规模增长显著。百融智能正战略升级,以新一代AICC智能联络技术向多行业拓展,其创始人张韶峰分享了相关思考与技术优势。
华师大智金院孵化金融原生基模Mint-Agent:超越GPT-5.6与Claude Opus 4.8,商业订单已超亿元
华东师大智金院团队孵化的金融原生基模 Mint - Agent 发布,在 FinanceAgentBench v2 上表现超 GPT - 5.6 - Sol 与 Claude Opus 4.8,单题推理成本低,商业订单超亿元,进入规模化金融场景验证阶段。