「科研任务」共找到 2288 篇相关文章
DeepMind率先提出CoF:视频模型有自己的思维链
DeepMind在Veo 3论文中提出帧链CoF概念,类比语言模型CoT,让视频模型能时空推理。实验显示Veo 3有通用视觉理解能力,能零样本解决视觉任务,未来通用视频模型或取代专用模型。
OpenAI研究大模型对GDP贡献,三大行业已能代替人类,并自曝不敌Claude
OpenAI推出新评估方法GDPval,跟踪模型在现实任务表现。评估显示前沿模型接近专家水平,Claude Opus 4.1表现最佳,GPT - 5准确性出色。还发布黄金子集和评分服务,其处于起步阶段将持续扩展。
“扁平+拓扑”双索引,85页PDF"秒级"推理,MMRag幻觉率骤降76%
多模态长文档视觉问答常见于科研论文等场景,现有技术路线有大视觉 - 语言模型直接端到端和检索增强生成,但各有缺点。MMRAG - DocQA引入新方案,解决多模态连接和跨页证据链接问题。
谷歌开源新Deep Research范式,教Agent学会真正的思考。
周末谷歌发博客讲Deep Research,它重新定义一些Agent常见范式。现在多数Agent模式缺全局观,谷歌让AI先打草稿再迭代修正。新框架含技巧,在多任务上超OpenAI,已可试用。
2.3K Star 霸榜GitHub!DeepResearch最佳开源平替!
DeepResearch能递归拆解复杂任务自动生成报告,但OpenAI的相关产品费用高且闭源。霸榜GitHub的ROMA由Sentient AGI团队开发,性能超Grok - 4等,是开源杀手,还介绍了功能、使用方法和应用场景。
具身VLA后训练:TeleAI提出潜空间引导的VLA跨本体泛化方法
现有VLA基座模型能力不足,跨本体适配存在挑战。中国电信人工智能研究院具身智能团队提出“对齐 - 引导 - 泛化”(ATE)框架,实现从调架构到调分布的范式转移,适配主流VLA模型,减少数据需求。
00后打造最强苹果开发Agent!刚刚,OpenAI打包收编
今天凌晨,Xcode最流行的编程Copilot插件Alex被OpenAI收编,团队加入Codex。Alex是Xcode亮眼插件,能实现自动化开发任务。其创始人是00后,经验丰富。OpenAI此举或为扩大在苹果生态影响力。
AI三问:Agent、LLM、RAG,一文厘清!
文章介绍大语言模型(LLM)、检索增强生成(RAG)和AI智能体(Agent)三种架构。阐述其概念、工作原理、应用场景、优缺点,还做了横向对比,给出选用建议,最后提及混合架构与未来趋势。
仅需152个样本,性能提升48%:Memory-R1如何重塑Agent记忆能力?
这篇文章解读论文Memory - R1,其由多所高校研究团队完成,旨在解决LLM在长对话和多轮任务中的‘记忆难题’。通过强化学习让LLM学会管理记忆,用152个问答对训练,大幅超越现有基线模型。
ICCV 2025 | ECD:高质量合成图表数据集,提升开源MLLM图表理解能力
科研等领域图表是信息核心载体,先进开源MLLMs在高难度图表理解测试准确率低。本文提出ECD数据集,规模大、质量高、风格多样,还设计合成流水线与评测基准ECDBench,为开源MLLM提供支持。