「人类式思考」共找到 2304 篇相关文章
DeepSeek-V3.2正式版发布,将开源模型的能力推向极致
DeepSeek-V3.2正式版开源,包含标准版和Special版。它采用稀疏注意力机制,降低计算复杂度。后训练阶段有多项算法改进,支撑高难度推理。还融合思考与工具使用,合成训练数据,在智能体评测表现优异。
黄仁勋李飞飞林斌投了同一家机器人公司
Generalist是专注给机器人“造通用大脑”的AI公司,创立不久便多次融资,估值超20亿美元。其GEN - 1.5有强大泛化能力,演示一次就能上手,但也有很大进步空间,展示了未来通用机器人大脑学习方式。
AI 时代,编程语言选型更难也更重要:Go、Rust、Python、TypeScript 谁该上场?
AI 写码成常态,编程语言选择更重要。创业者 Armin Ronacher 指出语言权衡需重审,会影响 Agent 代码质量。他认为 Go 在 AI 场景合适,公司绕不开 Python 和 JavaScript。还分析多种语言特点、适用场景及 AI 对编程的影响。
EMNLP 2025 浙大&蚂蚁 | 提出动态压缩CoT推理新方法:LightThinker
随着AI发展,大语言模型处理复杂推理任务能力提升,但推理时产生大量中间步骤和文本,拖慢计算速度、增加资源压力。浙大、蚂蚁等机构研究者提出LightThinker,可动态压缩推理步骤,降低内存占用和计算成本。
AI长身体,直接做实验!自主通用科学家,科研界的Scaling Law来了
本文探讨未来科研范式「自主通用科学家」(AGS),它将AI与机器人技术结合实现科研全流程自动化,有望突破人类科研限制,引发科学范式变革,还介绍了相关架构、优势及面临的挑战和应对策略。
挤干大模型高分「水分」!最强模型仅49分,南大傅朝友发布Video-MME-v2
南京大学傅朝友团队在 Google Gemini 评测团队邀约下推出视频理解新基准 Video-MME-v2。它有创新的分层能力体系与组级非线性评分,揭示模型与人类的巨大鸿沟、传统 Acc 指标虚高、“Thinking”并非总是增益等现象。
ICML 2025 Spotlight | 多模态大模型暴露短板?EMMA基准深度揭秘多模态推理能力
最新研究推出 EMMA 基准测试,揭示顶尖多模态大语言模型在深度视觉与文本融合的复杂多模态推理上显著不足。该研究已被 ICML 2025 接收,代码数据开源。实验表明,现有模型与人类专家差距大,视觉推理是核心瓶颈。
强化学习之父:LLM主导只是暂时,扩展计算才是正解
新晋图灵奖得主、强化学习之父Richard Sutton在新加坡国立大学演讲时预测,大模型主导是暂时的,未来五年甚至十年内不是技术前沿。他认为AI应从依赖人类数据转向体验学习,强化学习潜力需靠扩展计算支撑。
MLLM集体翻车,缺乏婴儿级常识!业界首个核心认知基准发布,LeCun转赞
当前大模型在12项核心认知上普遍落后人类10 - 30%,越大的模型越易靠「背答案」糊弄。团队公开首个系统评测框架和题库,用Concept Hacking方法识破模型真假理解,指出模型存在核心知识缺失等问题。
Grok 4刷新ARC-AGI-2纪录:15.9%碾压所有公开模型,我们离AGI还有多远?
xAI的Grok 4在ARC-AGI-2测试中获15.9%,成全球最强公开AI模型。ARC Prize主席还原测试过程,虽成绩亮眼,但网友有质疑,且离人类表现差距大。Grok 4在多基准测试领先,定价便宜。