自主推理能力」共找到 4887 篇相关文章

开源动态8

给Agent装上“海马体”!上海AILab开源MemVerse,定义多模态记忆新范式

上海人工智能实验室开源MemVerse,这是首个面向智能体的通用多模态记忆框架。它将多模态信息与文本对齐到统一语义空间,首创‘双通路’架构与‘记忆蒸馏’技术,让智能体有终身记忆能力,在多模态任务中表现出色。

量子位
新闻资讯8

GPT-5.4发布:OpenAI首个大一统模型,简直是龙虾原生

OpenAI发布GPT - 5.4,这是其首个大一统模型,将推理、编程等能力融合,且单项性能领先。它在知识工作、计算机使用、编程调试等能力提升,定位AI数字员工,虽单价高但有省钱机制。

量子位
开源动态7

里程碑!Artificial Analysis:Mac能跑的两款开源模型正式追上GPT-5

据Artificial Analysis报告,32B以下开源模型比肩GPT - 5。Qwen3.5 27B、Gemma 4 31B分别与GPT - 5中杯、小杯智能水平相当,虽知识全面性落后,但智能体表现和批判性推理进步大,硬件门槛低。

AI寒武纪
算法论文8

答对了却没看图?EASE给多模态RLVR装上「视线校正器」

强化学习与可验证奖励提升视觉语言模型推理能力,但存在答案奖励只知对错、不知证据区域问题。哈工大等团队提出EASE,把标注证据区转为目标分布,监督空间注意力,推理无额外标注,实验成绩优异。

机器之心
开源动态8

秋招超强助攻:零基础1小时上手GPT微调!全流程教程免费开源

新一年秋招季,岗位对AI能力要求提升。OpenAI发布新开源大模型GPT - OSS,博主Lorentz Yeung开源本地部署和微调训练GPT - OSS的教程,助零基础者上手,还介绍环境搭建、代码和训练前后效果对比。

新智元
开源动态8

o3绞尽脑汁仅答对40%的题目,开源模型基本乱猜?MMSI-Bench:多图空间智能试金石

文章介绍了MMSI - Bench,这是用于评估MLLM多图像空间推理能力的VQA基准。它人工构建样本、全面分类任务、采用多样真实数据。实验显示MLLM在多图像空间推理有短板,还开发自动化错误分析流程助力改进。

量子位
新闻资讯7

大模型玩不好数独?!Transformer作者初创公司公布排行榜:o3 Mini High“变异数独”正确率仅2.9%

Transformer作者初创公司Sakana AI公布AI解决数独能力排行榜,用全新基准Sudoku - Bench考验大模型创造性推理能力。结果显示大模型总体正确率仅15%,9×9数独中高性能模型o3 Mini High正确率2.9%。

量子位
产品应用7

OpenClaw 引爆 AI 安全焦虑,Armadin 的 Agent 攻防闭环会成为新范式吗?

OpenClaw走红使agent自主执行任务能力受关注,也带来网络安全风险。传统安全体系难应对,Google高价收购云安全公司释放信号。Armadin构建agent swarm系统形成自主防御闭环,介绍其理念、产品、案例及面临的技术挑战。

海外独角兽
推荐文章7

2025小结:从RL到Agentic RL

作者回顾2025年从RL到Agentic RL的发展,指出Agentic RL存在慢、不稳定、难scale的问题,还探讨了RL与推理、CoT的关系,以及RL的泛化能力,认为RL能提升模型能力但还不稳定,期待明年研究。

深度学习自然语言处理
产品应用8

首家AIOS落地来自vivo:个人化智能复刻人类思维,手机还能这样用

2025年vivo开发者大会展示全新端侧AI能力,提出蓝心3B端侧多模态推理大模型,融入OS底层,实现系统级智能。其AI OS打造“个人化智能”体验,还开放生态,携手开发者推动AI应用落地。

机器之心