数学危机」共找到 456 篇相关文章

算法论文7

大模型刷数学题竟有害?CMU评估20+模型指出训练陷阱

CMU团队评估20多个大模型,发现只有强化学习(RL)训练的模型能将数学推理技能广泛迁移到其他任务,监督微调(SFT)训练的模型迁移有限甚至无迁移。研究还探索差异原因,表明RL微调更具优势。

量子位
算法论文7

Reasoning模型可以Self-Train!

当前大模型依赖人类标注数据,成本高且扩展难。论文探讨模型自我纠错、自主进化可能,提出自我奖励训练(SRT),用投票共识代替人类标注。在数学数据集上有效果,但高难度数据集出现问题,作者给出解决办法并开源代码。

深度学习自然语言处理
新闻资讯7

澜起科技:高速互连芯片巨头历史

文章讲述澜起科技发展历程。它从电视机顶盒芯片转型内存接口、高速互连芯片,虽历经政策冲击、做空危机、供应链压力与客户竞争等挑战,但凭借技术实力和研发投入,在行业中站稳脚跟,未来有望受益于AI算力需求升级。

芯师爷
新闻资讯7

IMO题库“过时”了!OpenAI内部模型挑战最新First Proof,做了7天错了一半

谷歌发布Gemini 3 Deep Think爆火后,OpenAI用未发布内部模型,一周内尝试解答10道来自数学家科研现场的真实问题,5道基本正确。这些题取自真实研究,切断模型“背答案”可能,意味着自主推理能力进化。

量子位
新闻资讯7

ChatGPT聊天记录成法庭铁证,韩国汽车旅馆双命案反转

韩国一女子用含苯二氮䓬类药物的饮料毒杀两名男子,警方从其手机挖出与ChatGPT的对话记录,成判定其杀人意图的铁证。此案件暴露AI安全漏洞,也引发对AI失控风险及数据隐私的担忧。

新智元
新闻资讯8

一个「流浪」数学家的遗产,正在被AI公司疯抢

2026年,OpenAI等公司用AI解决多个匈牙利数学家Paul Erdős提出的问题,震动数学界。这些问题分布广、难度跨度大,适合模型测试。不过,AI证明的验证和人类数学家地位受关注。

机器之心
算法论文7

无需训练!让VLM同时具备「视觉」与「推理」能力,数学题得分暴涨30%

当前视觉语言模型(VLM)像‘视力好但数学差的学生’,论文指出问题根源是数据不足和能力分布不均。提出‘模型合并’方案,实验显示在数学基准测试中表现亮眼,还通过实验揭示层间能力分布。

深度学习自然语言处理
新闻资讯7

十分钟出结果,陶哲轩用Gemini Deepthink帮人类数学家完成Erdős问题论证

Erdős问题网站专注数学研究与解答,收录厄尔德什提出的各类数学问题。11月20日,Wouter van Doorn提出反例,陶哲轩提交给Gemini 2.5 Deep Think,十分钟得到证明,他半小时转为基础证明。之后Boris Alexeev用Harmonic的Aristotle工具完成形式化。

机器之心
新闻资讯7

对话 PyTorch 掌门人 Matt White:AI 应用应该做到“润物细无声”

近日,PyTorch 基金会执行董事 Matt White 在北京智源大会指出,开源虽形成‘良性循环’,但围绕‘开放’定义权的战争已打响。他还分享了对 PyTorch 发展、AI 应用等多方面的看法。

AI科技大本营
新闻资讯7

在上海,与4位国际大咖一起追问未来:人机协作时代,艺术何为?

在人机协作时代,艺术意义引人深思。上海一场论坛邀四位大咖探讨创作,将不可见存在转化为美学体验,跨越学科界限,思考人类创造力、责任及艺术共情作用。

MANA新媒体艺术站