「数学统一」共找到 796 篇相关文章
LLM加RL遭质疑:故意用错奖励,数学基准也显著提升,AI圈炸了
华盛顿大学等机构论文引爆AI界,其发现用虚假奖励训练Qwen2.5-Math-7B模型,也能提高MATH - 500成绩。虚假奖励对Qwen模型有效,但在其他模型上有限,凸显RLVR有效性与模型能力有关。
对话微软研究员华文越:横跨数学、哲学与计算机,她如何重构 Agent 的信任基石?
本期访谈邀微软研究员华文越跳出技术视角,探讨如何用跨学科思维解决Agent落地难题,如找模型等间最优解、建信任标准,还将深入其工作逻辑及对Agent未来思考。4月18日直播。
ICLR 2026 | LongHorizonUI:让 GUI 智能体不再"半途而废"——面向长链路任务的统一鲁棒自动化框架
近年来,基于多模态大语言模型的GUI智能体在自动化操作上虽有进展,但任务步数超10 - 15步时成功率断崖下跌。研究人员提出LongHorizonUI框架,构建LongGUIBench评测基准,推动GUI自动化在复杂场景落地。
AI 找到了六个 Erdos 数学问题,陶哲轩:AI + 人类专家才是真正改变科学研究的方式
菲尔兹奖得主陶哲轩分享,AI 在 Erdos 问题网站实验中,帮数学家发现六个原本标记为「未解决」的问题其实已被解决。他认为 AI 有价值的应用是处理枯燥日常工作,如文献搜索。
详解Github 35K+项目:打通200+数据源,构建企业级AI的数据统一入口,支持MCP【下篇】
本文继续介绍MindsDB这款开源AI数据引擎,阐述知识库与混合检索应用,如创建向量索引、语义检索、多源混合检索等;还提及RAG与数据智能体,包括构建RAG管道和配置Data Agent;最后给出应用建议,称其适合复杂企业环境。
刚刚,奥特曼放出ChatGPT「统一智能体」!惊呼真AGI,最卷打工人来了
奥特曼带队直播发布ChatGPT agent,它融合三大技术优势,可自主工作,还能上网直出PPT、Excel。在多项测试中刷新SOTA,2025年将成全新AI杠杆,解锁「超级个体」模式。
CVPR2025视频生成统一评估架构,上交x斯坦福联合提出让MLLM像人类一样打分
Video-Bench视频评估框架由上海交通大学、斯坦福大学等团队提出,能让MLLM像人一样评估视频。它构建双维度评估框架,引入链式查询和少样本评分技术,突破现有评估方法限制,更全面智能地评分。
Claude 4如何思考?资深研究员回应:RLHF范式已过,RLVR已在编程/数学得到验证
Anthropic两位研究员在博客采访中透露Claude 4思考细节。提到可验证奖励强化学习RLVR在编程和数学领域获证明,探讨了RL扩展、模型自我意识等,还为大学生给出AI领域建议。
OpenClaw安全有救了!不改内核、无视AI内部逻辑,数学级枷锁驯服暴走智能体
OpenClaw等智能体能力强大但有安全黑洞,南方科技大学和香港科技大学团队推出ClawLess框架,从底层系统调用源头扼杀智能体出格行为,通过形式化验证、物理隔离、动态验证等手段保障安全。
GPT-5 Pro独立做数学研究!读论文后给出更精确边界,OpenAI总裁:这是生命迹象
OpenAI研究人员喂给GPT - 5 Pro一篇凸优化问题论文,它读完给出更精确边界及证明。虽成果被人类论文反超,但思路不同,显示其有独立探索能力,OpenAI总裁称这是“生命迹象”。