人在循环中」共找到 8829 篇相关文章

算法论文8

腾讯混元 x MBZUAI 港中文新研究:将纠错纳入策略空间,Search-R2 重构搜索增强推理学习方式

过去大语言模型能力提升靠参数和数据扩张,但真实任务中此路径有局限。腾讯混元、MBZUAI、港中文联合团队提出Search - R2,将纠错纳入策略空间,抑制错误传播,多跳推理任务中优势显著。

AI科技评论
推荐文章7

一篇综述:知识图谱的3种类型,6大推理任务

知识图谱(KGs)认知智能系统中作用关键,知识图谱推理(KGR)能基于现有事实推断新知识。文章综述了3种知识图谱类型、6大推理任务,介绍推理方法、应用,还指出KGR面临的挑战与机遇。

CourseAI
推荐文章8

我的 AI 原生开发流程:一个真实案例的完整复盘

作者复盘用 AI 给 App 加新功能的开发流程,指出 AI 原生开发本质还是传统流程,但执行主体从变成 Agent,是指挥官,确认决策;各环节有变化,文档更重要,大部分开发类 Skills 没必要。

宝玉AI
算法论文8

直接从像素到单词:这个原生大模型统一单图、多图、视频和空间智能

南洋理工大学等团队推出NEO - ov模型,挑战传统「视觉编码器 + 大模型」范式,直接从原始像素学语言。它多任务表现出色,尤其空间智能突出,但OCR等方面有短板,展现原生多模态建模潜力。

机器之心
算法论文8

ICLR 2026 | LongHorizonUI:让 GUI 智能体不再"半途而废"——面向长链路任务的统一鲁棒自动化框架

近年来,基于多模态大语言模型的GUI智能体自动化操作上虽有进展,但任务步数超10 - 15步时成功率断崖下跌。研究员提出LongHorizonUI框架,构建LongGUIBench评测基准,推动GUI自动化复杂场景落地。

机器之心
新闻资讯7

AI 编程冲击来袭,程序员怎么办?IDEA研究院张磊:底层系统能力才是护城河

AICon全球工智能开发与应用大会上,IDEA研究院张磊接受专访,剖析多模态智能体落地路径,分享工业界平衡研究与产品的见解,还为年轻AI浪潮中发展给出建议,指出底层系统能力是关键。

InfoQ
开源动态8

首个面向科学任务、真实交互、自动评估的多模态智能体评测环境,ScienceBoard来了

ScienceBoard是首个面向科学任务、真实交互、自动评估的多模态智能体评测环境。它集成多领域科研软件,构建科研任务集合,评估智能体科学任务上的表现,发现现有模型科研工作流中远未成熟。

机器之心
开源动态8

Qwen-AgentWorld:一个语言世界模型,模拟七大Agentic领域

今天正式发布 Qwen-AgentWorld,它是首个原生语言世界模型,能七大领域模拟智能体交互环境。同步发布 AgentWorldBench 评测基准。Qwen-AgentWorld 经三阶段训练,评测中表现出色,还探索两种范式增强通用智能体能力。

千问大模型
算法论文8

当SFT遇上RL:基于样本学习阶段的动态策略优化机制

大模型推理能力增强研究中,SFT和RL两种后训练范式难有效融合。研究团队提出DYPO动态策略优化方法,先判断样本学习阶段再匹配优化路径,多场景实验中表现出色,不过有实验边界。

量子位
开源动态8

ICCV25 Highlight|格灵深瞳RICE模型狂刷榜单,让AI「看懂」图片的每个细节

格灵深瞳公司灵感团队自研的视觉模型基座RICE(MVT v1.5)刷榜多项视觉任务,ICCV25获Highlight荣誉。它延续MVT系列理念,提升图片内部视觉特征差异性,多任务验证中表现优异。

机器之心