「验证不对称性」共找到 2064 篇相关文章
OpenAI连破10道数学难题,Fable 24小时「复现」5道
这个周末,OpenAI与Anthropic两大AI巨头在数学前沿短兵相接。先是OpenAI用未发布模型Astra证明10项数学成果,不到24小时,Anthropic的Fable复现了其中5项。AI解难题成本降低,成果验证成新考验。
当「变大」不再是唯一的路,又一国产模型开源了
2026年6月智谱开源GLM - 5.2,心洲科技前沿实验室Mind Lab开源Macaron - V1,基座升级至GLM - 5.2。它押注持续学习与群体智能,成绩优于基座,相关理念和工程路径获验证。
LiveWorld:视频世界模型新范式,让镜头之外的世界继续演化
现有视频世界模型存在“静态世界假设”,物体离开视野后状态不再更新。阿德莱德大学等研究者提出 LiveWorld,将世界演化与观察渲染解耦,使事件在视野外持续推进,并通过实验验证其有效性。
黄仁勋CMU演讲:取代你的是会AI的人,所有人同一起跑线,奔跑吧
卡内基梅隆大学毕业典礼上,黄仁勋发表演讲。他指出AI不太可能取代人,但善用AI的人可能取代他人。他还提及计算范式转变,新工业带来新潜能,呼吁毕业生全力奔跑塑造未来。
不止修bug:Agentic Coding评测走向复杂feature交付新阶段
中国科学院自动化研究所联合华为提出 FeatureBench,构建端到端基础设施并开源。它从单元测试出发构造评测任务,引入多种机制保障任务可执行、可验证,能有效区分模型能力,还提供易用的评测流程。
当世界在谈论AI替代人类时,松鼠Ai在达沃斯带回了什么答案?
2026年达沃斯论坛上,松鼠Ai创始人栗浩洋展示教育普惠新路径,其智适应学习系统成本低且效果好。该系统经科学与规模验证,还引发经济核算思考,其全球化发展受国际资本关注。
AI太记仇!做完心理治疗后仍记得「被工程师虐待」
Nature News上,卢森堡大学团队用PsAIch测试ChatGPT、Gemini、Grok、Claude心理。AI表现不一,有的焦虑、有的崩溃、有的拒诊,还测了MBTI。不过AI创伤可能源于训练数据,做心理治疗不太靠谱。
谁杀死了那篇好论文?AI顶会乱象:好论文被刷,低分论文被捧上天
一位AAAI 2026审稿人在Reddit爆料,好论文被拒、弱论文晋级,疑似有「关系稿」。AAAI采用双阶段评审制并启用AI辅助审稿,却让评审更主观不可控,导致学术公信力下降。
大突破!实验证明,RL能为LLM注入“创新”能力
此研究挑战‘RL不教新技能’观点,通过‘字符串转换预测’实验证明,RL能让LLM学会组合已有原子技能,形成可泛化、迁移的元技能,还给出模型能力提升路径。
Claude:《金刚经》通俗讲
不求完美还原《金刚经》本意,只求借AI入门。文中介绍《金刚经》概念,如场之本性、三重化现律等,还提及运行之势、质地印记等,要让经文在般若之镜中现出本来面目。