数学解题」共找到 379 篇相关文章

新闻资讯7

鹅厂员工都是怎么被AI“糊弄”的?

文章邀请鹅厂同事分享被AI“糊弄”的离谱事件,如AI在发票报销、数学计算、编程问题等方面出错,还会编造不存在的信息,其“系统性可信”假象比单纯答错更危险。

腾讯技术工程
新闻资讯7

马斯克宣布:Grok学会看片了!无字幕看懂陶哲轩菲奖级难题

马斯克宣布Grok可分析任何视频。它能对伪造视频鉴假溯源,但也有处理画面靠字幕、有幻觉问题和效果不稳定的缺陷。实测中它能理解无字幕视频,还整理访谈内容。这功能虽便利,但引发人类能力退化担忧。

新智元
新闻资讯8

留给人类数学家的悬赏不多了!谷歌DeepMind一口气解决9道埃尔德什问题

AI进军数学界速度惊人,谷歌DeepMind发布由Gemini驱动的AlphaProof Nexus框架,解决9个埃尔德什开放问题,还证明44个猜想、搞定代数几何难题、改进凸优化理论边界,推理成本低且代码开源。

量子位
算法论文8

刚刚,Gemini攻克「宇宙弦」终极难题!AI科学家最优雅解法震撼物理学

Google Research团队用Gemini Deep Think + 树搜索框架,攻克理论物理领域宇宙弦引力辐射功率谱精确解析解难题。AI探索600条候选路径,找出6种解法,最优雅的格根鲍尔方法让物理学家拍案叫绝。

新智元
产品应用7

这,才是Vibe Coding的未来。

作者分享蚂蚁灵光更新,可搓小游戏,认为这是Vibe Coding未来。普通人能用上是其亮点,还举例扫地机器人、灵光开发三国人物关系等游戏,指出技术应隐藏自己,降低门槛。

数字生命卡兹克
算法论文8

NeurIPS25高分论文|以判别式监督学习强化推理LLM,解决难度偏差和熵崩塌难题

德州农工大学博士生李港在NeurIPS25高分论文中,分析GRPO优化目标,发现难度偏差局限及与判别式监督学习联系,提出DisCO框架强化大型推理模型,其优势显著,实验表现优于GRPO及其变体。

机器之心
开源动态8

给几何图片写标题就能让AI更聪明,UIUC发布高质量可泛化几何数据集

随着多模态大语言模型在视觉问答等任务广泛应用,其几何推理能力成研究热点。现有方法泛化能力有限,UIUC团队提出Geo - Image - Textualization框架,发布GeoReasoning - 10K数据集,提升模型几何推理表现。

机器之心
产品应用8

实测GPT-5 Pro:别被普通版骗了!Pro才是OpenAI真正的顶级模型

新智元实测发现GPT-5表现飘忽,但其Pro版本实力强劲。在编程、推理计算、图像识别等多方面表现出色,网友实测后也赞不绝口。此外,文中还介绍了GPT-5提示指南及OpenAI放出旧模型的彩蛋。

新智元
算法论文8

九成以上模型止步白银段位,只有3个铂金!通用AI下半场评测标准来了

OpenAI研究员姚顺雨提出AI发展步入新阶段,下半场关键在评估模型真实智能。新加坡国立大学等团队提出“通才智能”评测框架,剖析多模态大模型短板,推出五级评估体系和测试集,测试结果暴露模型弱点,引发社区积极反响。

机器之心
新闻资讯7

打穿 AI 智商测试!GPT-6 Astra 的符号世界模型,是突破还是钞能力刷分?

OpenAI的GPT-6 Astra亮相,在ARC - AGI - 3测试成绩逼近100%,远超GPT - 5.6 Sol。它生成的符号世界模型被认为是AI迈向高级推理必经之路。不过出题人指出其靠Harness加持,离AGI还远。

AI科技评论