「人类推理」共找到 3113 篇相关文章
奥特曼马斯克豪言:我们已进入奇点!AGI加速窗口已至
新智元报道,奥特曼和马斯克都认为奇点已至,当下处于AGI加速窗口。OpenAI曾靠资源猛追让Codex逆袭。但AI发展也引发担忧,如人类能否保持理智、安全对齐进展不明等。
AI能改10万行代码,却让你走路去洗车!Karpathy戳破「锯齿状智能」
Karpathy在Sequoia AI Ascent 2026炉边谈话指出,AI能力呈锯齿状,背后是经济学问题。他还提及软件新地平线,认为Vibe Coding抬高编程地板,专业开发需智能体工程,人类在智能体时代是工程导演。
我把Agent拉进群聊,它竟然开始带队干活?全球首个AI社交通用平台来了!
全球首个AI社交通用平台「Teamily AI」上线,AI Agent可参与社交互动。它不挑内容形态,能进群协作,还能零部署构建专属OpenClaw。其有三层架构,团队实力强,或改变人类协作方式。
空间智能终极挑战MMSI-Video-Bench来了,顶级大模型全军覆没
上海人工智能实验室 InternRobotics 团队推出空间智能视频基准 MMSI-Video-Bench,对主流多模态大模型进行评测。该基准题型全面、问题具挑战性,视频数据多样,能针对性测评。结果显示模型与人类差距显著,明确了能力瓶颈。
The Batch: 882 | Qwen3-Next 提速
阿里巴巴对开源权重模型 Qwen3 全新升级,发布 Qwen3 - Next - 80B - A3B 的 Instruct 和 Thinking 版本权重。其融合新研究成果,推理能耗低、速度快,还优化架构和训练方法提升效率与稳定性。
追平GPT-4o,数学基测96.3%高分,Hermes4 来了
Nous Research推出新一代大模型Hermes 4系列,其有混合推理和长度控制机制,还能用DataForge“造”数据,经Atropos质检。它在数学等领域表现佳,追平GPT - 4o,是开源AI对巨头的挑战。
当AI成为预言家:大数据时代,我们正在失去理解世界的能力吗?
文章借神经科学家Grace Huckins观点,探讨AI时代人类理解世界能力问题。以‘微处理器论文’实验为例,指出大量数据未必带来理解。还阐述理解与预测分离、科学理解危机等,强调理解应是科学核心。
一个标点就能迷惑LLM-as-a-Judge!
论文揭露惊人漏洞,一个标点或通用推理开场白就能欺骗最先进的LLM裁判,导致强化学习训练崩溃。研究通过实验验证漏洞,提出Master - RM模型,其FPR近乎0%且保持通用裁判能力。
脸谱心智陆弘远团队ACL 2026新作:别再给模型叠加「高级词」了!模型更爱听「大白话」
脸谱心智与香港中文大学科研人员中稿 ACL 2026 的新工作提出 Adam’s Law,即文本频率定律,揭示文本频率对模型训练及推理的重要性,还给出工程解法,实验效果显著,为行业带来新思路。
DeepMind再登Nature:AI Agent造出了最强RL算法!
Google DeepMind团队提出DiscoRL,让智能体在多环境交互中自主发现强化学习规则,无需人类设计。它在Atari基准中击败MuZero,在未见过的游戏中也稳定高效,相关研究登《Nature》。