泛化推理能力」共找到 4674 篇相关文章

开源动态8

马斯克转发字节Seed&哥大商学院新基准:大模型搞金融,连查个股价都能出错

字节跳动Seed团队与哥大商学院推出开源金融搜索与推理基准测试FinSearchComp,含635个问题。评测显示大模型处理金融任务有差距,凸显金融AI能力评估重要性,还揭示了关键能力差距。

量子位
新闻资讯7

DeepSeek-R2要来了?

DeepSeek-R1发布一周年之际,其存储库更新引用全新「model 1」模型,极可能是R2。HuggingFace发文称R1降低技术、采用、心理三重壁垒。R1以推理优先,改变多项认知,故事仍在继续。

新智元
开源动态8

DeepSeek出品,必是精品!DeepSeek-OCR 2发布:让LLM像人一样读懂复杂文档,效果超Gemini 3 Pro

DeepSeek推出DeepSeek-OCR 2,提出“视觉因果流”,以全新视觉编码器赋予模型因果推理能力。它在文档解析基准表现超Gemini 3 Pro,代码和模型权重已开源,为2D推理和原生多模态探索铺路。

AI寒武纪
开源动态7

从GPT-2到gpt-oss,深度详解OpenAI开放模型的进化之路

OpenAI 近日发布 gpt-oss-120b 和 gpt-oss-20b 两个开源模型,Sebastian Raschka 发布博客对其详细分析,回顾自 GPT - 2 以来 AI 社区进步,还与 Qwen 3 比较,介绍架构、训练、推理等细节。

机器之心
开源动态8

给Agent装上“海马体”!上海AILab开源MemVerse,定义多模态记忆新范式

上海人工智能实验室开源MemVerse,这是首个面向智能体的通用多模态记忆框架。它将多模态信息与文本对齐到统一语义空间,首创‘双通路’架构与‘记忆蒸馏’技术,让智能体有终身记忆能力,在多模态任务中表现出色。

量子位
新闻资讯8

GPT-5.4发布:OpenAI首个大一统模型,简直是龙虾原生

OpenAI发布GPT - 5.4,这是其首个大一统模型,将推理、编程等能力融合,且单项性能领先。它在知识工作、计算机使用、编程调试等能力提升,定位AI数字员工,虽单价高但有省钱机制。

量子位
算法论文8

LLM-based Reranker效果到底如何?一项关于SoTA模型的全面分析

在信息爆炸时代,重排序是信息检索系统核心。论文对22种重排序方法实证研究,构建无污染数据集FutureQueryEval。结果显示LLM重排序器泛化能力被高估,轻量级模型有优势,为研究和应用提供指南。

深度学习自然语言处理
算法论文8

ICML 2025 | 清华、上海AI Lab等提出傅里叶位置编码,多项任务远超RoPE

长文本能力对语言模型重要,但现有模型训练窗长有限,流行的RoPE也有局限。清华、上海AI Lab团队用傅里叶分析解读其不足,提出傅里叶位置编码FoPE,提升长文本泛化能力,实验表现超RoPE。

机器之心
开源动态7

里程碑!Artificial Analysis:Mac能跑的两款开源模型正式追上GPT-5

据Artificial Analysis报告,32B以下开源模型比肩GPT - 5。Qwen3.5 27B、Gemma 4 31B分别与GPT - 5中杯、小杯智能水平相当,虽知识全面性落后,但智能体表现和批判性推理进步大,硬件门槛低。

AI寒武纪
算法论文8

答对了却没看图?EASE给多模态RLVR装上「视线校正器」

强化学习与可验证奖励提升视觉语言模型推理能力,但存在答案奖励只知对错、不知证据区域问题。哈工大等团队提出EASE,把标注证据区转为目标分布,监督空间注意力,推理无额外标注,实验成绩优异。

机器之心