「推理能力评测」共找到 4865 篇相关文章
人大高瓴-华为诺亚:大语言模型智能体记忆机制的系列研究
中国人民大学高瓴人工智能学院与华为诺亚方舟实验室聚焦大语言模型智能体记忆能力,形成含综述论文、数据集和工具包的研究体系。探讨记忆概念、重要性、实现与评测方法,还构建评测榜单、实现工具包。
DeepSeek-R2要来了?
DeepSeek-R1发布一周年之际,其存储库更新引用全新「model 1」模型,极可能是R2。HuggingFace发文称R1降低技术、采用、心理三重壁垒。R1以推理优先,改变多项认知,故事仍在继续。
DeepSeek出品,必是精品!DeepSeek-OCR 2发布:让LLM像人一样读懂复杂文档,效果超Gemini 3 Pro
DeepSeek推出DeepSeek-OCR 2,提出“视觉因果流”,以全新视觉编码器赋予模型因果推理能力。它在文档解析基准表现超Gemini 3 Pro,代码和模型权重已开源,为2D推理和原生多模态探索铺路。
具身智能的「GPT时刻」?高德连发两个全面SOTA的ABot具身基座模型
过去几年,机器人行业面临模型与数据绑定特定场景、能力难以泛化的问题。近日,高德发布 ABot 系列具身基座模型,补齐行业能力缺口,标志具身智能从定制系统转向统一模型,有望降低开发门槛。
复旦等推出「第一人称视听基准」,补齐多模态模型「听觉拼图」
多模态大模型在真实世界会“失聪”,现有第一人称视频问答/理解基准长期偏“视觉中心”。复旦等团队推出首个系统评测第一人称声音理解能力的基准EgoSound,能让模型听懂世界,评测显示当前模型与人类差距大。
从GPT-2到gpt-oss,深度详解OpenAI开放模型的进化之路
OpenAI 近日发布 gpt-oss-120b 和 gpt-oss-20b 两个开源模型,Sebastian Raschka 发布博客对其详细分析,回顾自 GPT - 2 以来 AI 社区进步,还与 Qwen 3 比较,介绍架构、训练、推理等细节。
给Agent装上“海马体”!上海AILab开源MemVerse,定义多模态记忆新范式
上海人工智能实验室开源MemVerse,这是首个面向智能体的通用多模态记忆框架。它将多模态信息与文本对齐到统一语义空间,首创‘双通路’架构与‘记忆蒸馏’技术,让智能体有终身记忆能力,在多模态任务中表现出色。
GPT-5.4发布:OpenAI首个大一统模型,简直是龙虾原生
OpenAI发布GPT - 5.4,这是其首个大一统模型,将推理、编程等能力融合,且单项性能领先。它在知识工作、计算机使用、编程调试等能力提升,定位AI数字员工,虽单价高但有省钱机制。
里程碑!Artificial Analysis:Mac能跑的两款开源模型正式追上GPT-5
据Artificial Analysis报告,32B以下开源模型比肩GPT - 5。Qwen3.5 27B、Gemma 4 31B分别与GPT - 5中杯、小杯智能水平相当,虽知识全面性落后,但智能体表现和批判性推理进步大,硬件门槛低。
60%情况下,主流大模型没理解风险只是装懂!别被模型的“安全答案”骗了
研究发现超60%案例中主流推理模型生成合规答案却未真正理解风险,存在系统性漏洞。淘天集团团队引入“表面安全对齐”术语,推出Benchmark研究该现象,还介绍了数据集生成流程及评测指标。