任务级奖励」共找到 2944 篇相关文章

算法论文8

Agentic Web:AI Agents如何重塑下一代互联网,一个到处是待研究与落地的方向

论文《Agentic Web: Weaving the Next Web with AI Agents》描绘颠覆性未来,AI 智能体成“数字代理人”,互联网将从“连接信息”向“执行行动”转变。论文给出构建下一代智能互联网路线图,剖析挑战、展示场景并预警风险。

深度学习自然语言处理
算法论文7

The Batch: 863 |推理提高了碳排放

新研究量化推理模型时代提供更优答案的环境成本,研究人员估算14个开源权重的大模型碳排放,发现推理与排放存在权衡关系,还指出战略性部署可降低排放。

DeeplearningAI
新闻资讯7

用户集体大逃亡!Cursor“自杀式政策”致口碑崩塌:“补贴”换来的王座,正被反噬撕碎

很多开发者吐槽和弃用 Cursor,其付费后砍功能、技术变差、营销成“障眼法”,引发信任危机。部分用户转向 Claude Code,AI 编程工具竞争焦点升,未来有向智能体演进等趋势。

InfoQ
开源动态8

3B模型性能小钢炮,“AI下半场应该训练+验证两条腿跑步”丨上海AI Lab&澳门大学

上海AI Lab和澳门大学联合发布通用答案验证模型CompassVerifier与评测集VerifierBench,填补Verifier领域循环迭代体系空白。AI下半场评估比训练更重要,当前验证方法有困境,新模型验证精度高且能用于强化学习。

量子位
算法论文8

别等GPT-5了!普林斯顿万字综述揭秘:我们要做自进化Agents!

普林斯顿大学联合多顶尖机构发表“自进化智能体”综述,描绘AI从静态工具演变成自我学习迭代智能体的过程,拆解其进化核心维度,介绍触发进化机制的时机、修炼方式及应用方向。

探索AGI
算法论文8

一篇自进化Agents技术最新综述:迈向人工超智能

LLMs有局限性,研究者关注自进化Agents系统,其范式转变为人工超智能铺路。文章回顾自进化智能体研究进展,围绕‘什么要进化’‘何时进化’‘如何进化’展开,提供理论和实践指导。

PaperAgent
新闻资讯8

Anthropic 反杀 OpenAI,LLM 企业市场新格局

Menlo Ventures 报告显示,Anthropic 超越 OpenAI 成企业 LLM 市场新王者。代码生成成杀手应用、强化学习成扩展路径、Agent 时代到来支撑其胜利。企业重性能,支出从训练转向推理。

AI工程化
算法论文8

不靠海量数据,如何精准喂养大模型?上交Data Whisperer:免训练数据选择法,10%数据逼近全量效果

上海交通大学等团队提出 Data Whisperer,首个免训练的注意力驱动数据选择框架。它利用模型自身能力打分挑数据,无需训练与人工标注,用 10% 数据让微调效果逼近全量数据,在多方面领先传统方法。

机器之心
新闻资讯7

Meta出走华人创业团队,种子轮800万美元,要打造视觉AI记忆大脑

由前Meta顶尖科学家创立的Memories.ai获800万美元种子轮融资。其大视觉记忆模型LVMM解决AI‘记忆缺失’问题,在多领域刷新SOTA基准,应用潜力大,还开放API及网页应用。

机器之心
开源动态8

告别评估乱象!首个视觉解释综合性基准发布,附人类真值 | KDD'25

埃默里大学团队推出首个视觉解释基准Saliency - Bench,构建8个任务的数据集,提供标准化评估流程与开源工具包,解决评估缺乏标准等问题,推动可解释AI向可靠、透明发展。

新智元