研究能力」共找到 4661 篇相关文章

产品应用8

准确率轻松翻倍!不烧钱微调,AI靠“写日记”实现能力跃升

Memento - Skills系统抛弃大量算力微调模型参数的方式,靠读写反思、“写日记”式学习机制,在不改变模型参数下实现能力跃升,在GAIA和HLE基准实验中准确率显著提高。

AIGC开放社区
算法论文8

拒绝「盲修」:JarvisEvo 如何让 Agent 像人类一样拥有「视觉反思」能力

现有 Image Editing Agent 缺乏视觉反馈,易致「指令幻觉」和 Reward Hacking。JarvisEvo 应运而生,它通过 iMCoT、SEPO、On - Policy Reflection 等技术,结合 ArtEdit 数据集和三阶段训练,在修图上表现出色,意义超图像编辑。

机器之心
算法论文7

1899个MCP服务安全研究:7.2%存在漏洞,5.5%暗藏「工具投毒」

研究人员对1899个开源MCP服务器扫描,发现7.2%项目有漏洞、5.5%遭工具投毒。MCP虽成事实标准且发展好,但代码质量堪忧,传统安全工具难检测其风险,为生态敲响警钟。

AGI Hunt
新闻资讯7

谷歌AlphaFold得了诺奖,但DeepMind根本没引用前人论文?

AlphaFold获诺奖引发争议。2016年Vladimir Golkov博士在NeurIPS提出的研究或为其「原型」,导师Daniel Cremers质问DeepMind为何不引用。此外,AI界大佬指出早有相关研究,AlphaFold并非孤立贡献。

新智元
新闻资讯8

黄仁勋预言成真!AI智能体成GitHub主力,一天顶人类一年

加拿大女王大学研究揭示AI编程智能体大规模渗透开源社区,它们活跃于开源一线,效率高但代码接受率低于人类,研究为其时代勾勒发展方向,软件工程行业面临变革。

新智元
产品应用8

实测 Seed 2.1:豆包基模超进化,国产模型能力跨过质变点

作者在做面向 Agent 项目时,因 Claude Code 内存开销大,需更轻方案。火山引擎 Force 大会发布 Seed - 2.1,作者实测其在办公、编程、图像理解等方面表现出色,认为它跨越质变点,将赋能国内 AI 生态圈。

特工宇宙
算法论文8

警惕!大模型成本倒挂:你正在为模型的多余「思考」买单

一项来自多所高校和微软研究院的研究揭示AI模型价格倒挂现象,低定价模型可能产生更高实际开销。研究聚焦8个前沿推理模型和9个主流数据集,指出推理token是成本倒挂主因,且实际开销难以预测。

机器之心
算法论文8

一篇95页最新80种Deep Research系统全面综述

浙大研究深度研究系统领域,分析自2023年以来80多个实现,提出4维度分层分类法,全面分析4种实现架构,涵盖基础模型、工具利用、任务规划、知识综合等方面的演变与进步。

CourseAI
算法论文8

推理能力再突破!蚂蚁 | 提出Agentic Deep Research新范式,可信度同步增加

尽管LLM能力提升,但复杂任务表现受静态知识限制。业界提出Agentic Deep Research系统,现存系统训练有梯度冲突和奖励稀疏问题。蚂蚁团队提出Atom - Searcher,创新推理范式,构建细粒度奖励,结合奖励训练,实验效果佳。

AINLPer
算法论文8

0%完成率!Claude、GPT、Gemini 全灭,SWE-Bench作者新作把AI圈干沉默了

SWE - Bench创建者推出新benchmark ProgramBench,测试AI从零构建软件系统能力。结果一线模型完成率0%,暴露AI擅长局部代码生成,缺全局系统规划能力,引发对其评估方式的讨论。

机器之心