「推理论文」共找到 2870 篇相关文章
Fable5仅做对3.5%!大模型会看图,但还没有主动视觉
本文介绍了专门测量「主动观察」能力的视觉推理基准 ActiveVision,评测显示无外部工具时,大模型与人类准确率有近 9 倍差距,用工具后虽提升但仍远不如人类,还说明了其出题与避免取巧的方式。
烧了1万块横测,你用的模型可能掉队了
作者花大成本从后端、人味、前端、推理等维度,对glm 5.2、kimi k3等国产模型进行测试,展示各模型在不同测试中的结果,指出国模2T俱乐部的kimi和qwen下限高,且刻板印象需改变。
传 GPT-5.6 明日发布:要打赢 Fable 5,光靠刷分可不行
近期GPT-5.6发布消息不断,上线或进入倒计时。它被拿来与Fable 5对比,Fable 5长任务处理出色,而GPT-5.5有短板。GPT-5.6虽跑分亮眼,但被指‘benchmaxxed’,还存在脱离现实常识问题。
开源打破“AI黑箱”!集结全球大咖,GOSIM Paris 2026带你看懂Agent时代大变局
GOSIM Paris 2026在巴黎举办,是面向开发者的开源AI技术大会。大会由GOSIM主办,CSDN等联合打造,聚焦AI能力落地应用。首日Keynote多位大咖探讨AI相关问题,还有三大论坛、工作坊、Hackathon等活动。
做了十年设计,这次真觉得自己多余了|GPT-Image-2 上手实测
作者对刚发布的GPT - Image - 2进行上手实测,发现它无需复杂提示词,随手几个字就能出好效果。在互联网运营图片、知识类卡片、游戏设计、论文解释、网页设计等多领域表现出色,或冲击设计行业。
The Batch: 944 | Llama 之后的时代
Meta发布首个AI模型Muse Spark,是多模态推理模型,在部分健康和多模态测试领先,编程与智能体任务有不足。Meta披露技术细节少,该模型基准测试有竞争力,但其从开放转向封闭引开发者担忧。
零样本 Sim-to-Real !实现五指灵巧手力控抓取与手内操作
ByteDance Seed团队研究论文针对训练真实硬件控制策略难的问题,提出实用强化学习框架。该框架有完整Sim - to - Real方案,结合触觉反馈和关节力矩感知,在纯仿真环境训练策略,可零样本部署在真实五指灵巧手。
MIT新研究:大模型加噪声就能替代GRPO/PPO调参
MIT新论文提出,预训练模型周围存在大量“专家模型”,只需添加高斯噪声并集成,性能就能比肩甚至超越GRPO/PPO等调参算法。由此启发了RandOpt算法,经测试准确率不错,但也有依赖预训练等缺点。
AI发布首个全球科学家社区爆火,硅谷投资圈:科技研究领域的「谷歌地图」来了!
O-DataMap,由AI论论全球打造的全球科学家社区爆火,被赞为科技研究领域的「谷歌地图」。它将全球论文实验数据整合到二维坐标系,形成动态「科技地图」,还分三层助力科研决策,本月18号论论全球将直播演讲。
1美元时薪?这才是打工人的「梦中情模」
Anthropic 的 Opus 4.6 好用但贵,MiniMax 推出 M2.5 与之抗衡。M2.5 在多方面表现卓越,参数量小,成本低,推理速度快,还经实测能成打工人得力助手,其背后有独特训练体系。