长程任务能力」共找到 4577 篇相关文章

推荐文章7

与三位前沿研究者聊AI Agent:规则、环境与热潮下的真问题|五源小酒馆Vol.31

五源小酒馆对话三位AI Agent前沿研究者,探讨其发展进展、挑战。他们分享对Agent定义、能力边界判断等,提及过去技术突破,如DeepSeek工作,也指出通用Agent瓶颈,探讨未来模型能否提有价值问题等。

五源资本 5Y Capital
算法论文8

一个标点就能迷惑LLM-as-a-Judge!

论文揭露惊人漏洞,一个标点或通用推理开场白就能欺骗最先进的LLM裁判,导致强化学习训练崩溃。研究通过实验验证漏洞,提出Master - RM模型,其FPR近乎0%且保持通用裁判能力

深度学习自然语言处理
开源动态8

谷歌又来砸饭碗!免费AI Agent发布,程序员狂喜

谷歌发布免费开源的AI Agent——Gemini CLI,可在电脑终端运行。免费额度高,用个人谷歌账号登录就能用Gemini 2.5 Pro,还有大上下文窗口和高请求额度。它能力不止编码,功能强大且易上手。

CourseAI
算法论文8

116页论文教你「蒸馏」Claude、GPT-5.6:AI社区今天炸了

一篇前沿大模型安全漏洞论文引发热议,指出各大模型 API 设计缺陷,可提取隐藏思维链。同一模型家族安全能力不对称,攻击者可利用此漏洞,还介绍了攻击路径、实验及修复建议。

机器之心
算法论文8

Agentic RL 后训练资源怎么分?港中文、恒生大学提出 Libra,吞吐最高提升 3 倍

大语言模型走向“完成任务”,Agentic RL 后训练让系统工作负载不稳定。港中文和恒生大学团队提出 Libra 资源管理系统,统一优化训练与 rollout,在多任务中提升吞吐,论文与代码已公开。

机器之心
算法论文8

换个地面/身体,机器人策略就失灵?让扩散策略读懂「动力学」| ICML'26

扩散策略成机器人控制热门路线,但真实世界动力学多变,策略易失灵。UC Berkeley等联合提出DADP,训练统一策略,在零样本跨域控制任务表现强,尤其在OOD场景优势明显,还给出工程补充结果。

新智元
新闻资讯8

刚刚,黄仁勋公开批评了所有因为AI而裁员的 CEO:缺乏想象力

黄仁勋在GTC2026小采访中批评因AI裁员的CEO缺乏想象力。他认为AI放大人的能力,非替代工人,AI公司营收增长快,NVIDIA订单多还招人,他还提到新产品OpenClaw。

AI寒武纪
新闻资讯7

Anthropic失业报告炸场!22-25岁年轻人被斩杀,AI淘汰75%编程

Anthropic报告显示,程序员75%任务已被AI覆盖,客服、数据录入等岗位紧随其后。虽目前未造成明显失业潮,但22 - 25岁年轻人入职率降14%。报告预警AI对就业影响是十年‘温水煮青蛙’。

新智元
新闻资讯7

GPT-5.2破解数论猜想获陶哲轩认证!OpenAI副总裁曝大动作:正改模型核心设计,吊打90%研究生但难出颠覆性发现

OpenAI 发布由 GPT - 5.2 加持的科研平台 Prism 并免费开放。OpenAI 副总裁 Kevin Weil 回应入局科研领域问题,称模型能力超 90% 研究生,但难有颠覆性发现,还透露将优化模型设计。

AI前线
算法论文8

LLM内部竟藏着众多策略模型?自所&腾讯团队首次揭示大模型RL新机制

中国科学院自动化研究所与腾讯AI Lab团队,从可解释性分析出发,发现LLM内部含多个可采样内部策略,揭示不同模型推理熵模式,提出BuPO算法,在复杂推理任务上表现优于传统算法。

PaperAgent