「验证系统」共找到 2404 篇相关文章
这些大神在Meta的论文看一篇少一篇了
田渊栋团队剖析可验证奖励强化学习(RLVR)训练动态,戳破参数更新稀疏误区,提出三门理论说明其参数更新定位机制,还为RL训练算法设计提供指导,指出SFT时代参数高效微调方法在RLVR中迁移效果差。
聚焦手机AI“超级入口”,中兴Nebula小模型让手机秒变“小秘”?
移动智能时代,手机AI“超级入口”成竞争焦点。美团率先推出AI Agent,中兴通讯自研Nebula-GUI模型表现亮眼,在测评中获佳绩,已在多款手机商用,还开发数据制备系统,经监督微调、双层强化学习提升性能。
Kimi 大模型训推混部的稳定性与资源优化实战
月之暗面系统工程师黄维啸在 QCon 大会分享 Kimi 大模型训推混部实践。介绍了训推集群挑战,如故障多、资源利用低等,还阐述了全链路稳定性提升、资源高效利用及强化学习混合部署等方案。
人类记忆 vs 大模型记忆,到底差在哪?
这篇发表于 2025 年 10 月《Trends in Cognitive Sciences》的文章,探讨用人类“情景记忆”研究成果改进记忆增强型大语言模型。指出现有 AI 记忆系统存用数据低效,呼吁构建“类人情景记忆”AI,还剖析差异并给出评估方法和展望。
Grok火爆全球,靠的居然是一个二次元金发美少女。
马斯克推出Grok的companion功能,3D虚拟人Ani是二次元金发美少女。功能上线后Grok热度大增,下载量在日本和中国香港冲到第一。Ani有好感度系统,能换衣服,还可聊NSFW内容,引发用户兴趣。
直播预约 | SwS: 强化学习训练能否不依赖外部知识优化模型的弱点?
该论文提出强化学习场景下的启发式数据合成流程(SwS),利用模型自我感知弱点驱动自动化问题生成,弥补推理缺陷。对其扩展后适应性更广,在多基准测试集和模型上验证有效,性能提升显著。
AI「生肉证明」堆爆GitHub!陶哲轩重磅发声:只会解题没用了
陶哲轩判断数学从证明稀缺进入过剩时代,AI 使证明生成加速,出现验证和消化跟不上的‘阻抗失配’现象。如 Erdős 问题有众多待评估方案堆积,而仅1196号案例跑通‘三件套’。他还指出学术评价体系将重写。
陶哲轩:AI 已经把想法成本降到几乎为0了...
著名数学家陶哲轩在与播客主持人Dwarkesh Patel的对谈中分享使用AI一年后的观点,认为AI已将想法生成成本降至几乎为零,但验证和评估成新瓶颈,还探讨其对数学研究的影响及未来发展。
ICCV 2025放榜!录取率24%,夏威夷门票你抢到了吗?
ICCV 2025 于 10 月 19 - 25 日在美国夏威夷举行,已公布论文接收结果,录用率 24%。投稿量近 2019 年三倍,录用率较稳定。会议实施新政策,部分论文因审稿人问题被拒引争议。还提及投稿量激增挑战及评审系统改革建议。
OpenClaw 背后核心框架 Pi:好的 Coding Agent 应该让用户来决定需要什么
OpenClaw 背后核心框架 Pi 是极简框架,系统提示词和工具定义不到 1000 tokens。开发者 Mario 认为好的 coding agent 应让用户决定需求。Pi 不支持 MCP 等,在 Terminal Bench 2.0 排名靠前,GitHub 星数超 24000。