「偷看答案」共找到 185 篇相关文章
压缩即是全部 —— 菲尔兹奖得主给数学和 AI 的一封信
2026年3月,菲尔兹奖得主Michael Freedman发表论文《Compression is all you need》,用代数模型回答人类构建数学、人类与形式数学区别、人类数学家与AI协作三个问题,答案是“压缩”。文章还探讨了压缩在多领域的体现及对AI的意义。
苹果新论文发出惊人一问:What do your logits know?
苹果AI研究团队提交论文《你的logits知道些什么?(答案可能会让你惊讶!)》,触及大模型底层逻辑及苹果看重的用户隐私与数据安全。研究通过实验揭示模型信息留存状态,指出存在隐私泄露隐患。
LLM 仅靠自身就能增强推理?SePT 给出简洁在线自训练范式
多数推理后训练方法依赖外部信号,SePT仅用模型自身生成的答案自训练,能提升推理能力,数学推理任务准确率升10个点。它核心简洁,设计关键是温度解耦等,不损模型通用能力,代码易迁移复现。
Agent搜索哪家强?人大高瓴&快手联合发布全新评测基准GISA
人大高瓴与快手联合发布全新评测基准GISA,用于评估智能体搜索能力。它解决了现有基准反向构造、评估维度单一、答案易被记忆等问题,含373个高质量查询,实验显示当前搜索智能体距人类水平差距大。
敢和刘慈欣叫板的AI诞生了
在2025科幻星云嘉年华上,荣耀AI智能体YOYO与刘慈欣等科幻大咖对话,表达犀利观点。这展示其能力进化,也引出AI落地问题,答案指向手机。行业探索AI手机突围,荣耀Magic8或成关键产品。
什么都不做就能得分?智能体基准测试出现大问题
随着AI智能体走向实际应用,其基准测试变得至关重要。但现有基准测试问题多,如WebArena判错答案、τ - bench给无操作智能体高正确率。文章提出有效性判据和ABC清单,还揭示主流基准测试诸多问题。
AI仅凭“自信”学会推理,浙大校友复刻DeepSeek长思维链涌现,强化学习无需外部奖励信号
UC Berkeley团队提出新训练方法Intuitor,大模型无需接触真实答案,仅优化自身信心就能学会复杂推理。该方法无需外部奖励信号或标注数据,用模型自身置信程度作内在奖励信号,在多任务表现良好。
OpenClaw不会蛋炒饭!Ropedia放出人类经验,机器人「教科书」来了
当LeCun和李飞飞各自拿下10亿美元押注世界模型时,一个更底层的问题浮出水面:谁来为Physical AI提供真正能用的数据?Ropedia给出的答案,不是更多视频,而是一部结构化的、来自真实世界的「经验百科全书」。
3B模型性能小钢炮,“AI下半场应该训练+验证两条腿跑步”丨上海AI Lab&澳门大学
上海AI Lab和澳门大学联合发布通用答案验证模型CompassVerifier与评测集VerifierBench,填补Verifier领域循环迭代体系空白。AI下半场评估比训练更重要,当前验证方法有困境,新模型验证精度高且能用于强化学习。
MLLM集体翻车,缺乏婴儿级常识!业界首个核心认知基准发布,LeCun转赞
当前大模型在12项核心认知上普遍落后人类10 - 30%,越大的模型越易靠「背答案」糊弄。团队公开首个系统评测框架和题库,用Concept Hacking方法识破模型真假理解,指出模型存在核心知识缺失等问题。