科学能力」共找到 3415 篇相关文章

算法论文8

GRPO遭遇瓶颈?G²RPO-A让自适应指导为小模型推理能力「开外挂」

大模型推理能力难迁移到小模型,现有强化学习方法如GRPO在小模型上性能提升有限。香港中文大学(深圳)唐晓莹教授团队提出G²RPO - A算法,缓解小模型奖励稀疏问题,在多模型实验中表现优于vanilla GRPO。

机器之心
算法论文8

清华Nature发布惊人结论:AI写论文3倍速,但科学边界被锁死

2026年1月,清华徐丰力、李勇教授联合芝加哥大学团队在《Nature》发文,分析4100余万篇论文发现,AI提升科学家个人生产力,但收缩科学探索集体疆域。团队提出「全流程科研智能体系统」破局。

新智元
开源动态8

Kimi K2 Thinking突袭!智能体&推理能力超GPT-5,网友:再次缩小开源闭源差距

Kimi K2 Thinking发布并开源,主打“模型即Agent”,能边思考边用工具,连续工具调用200 - 300次。在多评测基准超GPT - 5等闭源模型,代码权重遵循MIT协议,可在官网和应用实测。

量子位
算法论文8

北大腾讯突破奖励模型瓶颈!让AI理解人类偏好,泛化能力比肩GPT-4.1

北京大学知识计算实验室联合腾讯等机构提出RewardAnything,突破奖励模型瓶颈。它让奖励模型理解自然语言评判原则,降低成本,泛化能力比肩GPT - 4.1,还能用于定制AI行为模式。

量子位
算法论文8

只用图像也能思考,强化学习造就推理模型新范式!复杂场景规划能力Max

现有 MLLM 依赖文本处理视觉信息,会造成信息丢失。剑桥、伦敦大学学院、谷歌团队提出视觉规划范式,以强化学习框架 VPRL 提升模型规划能力,实验显示其性能优于文本规划。

机器之心
开源动态7

AgentIF-OneDay 发布,评估全场景长时复杂任务

红杉中国 xbench 发布 AgentIF - OneDay 评测体系,用于评估大模型解决复杂任务的能力。该体系从任务复杂度新视角出发,沿 Scaling Context 和 Scaling Domain 推进,构造了三类典型任务进行测评,揭示了主流 Agent 的能力边界。

特工宇宙
新闻资讯7

全美罕见!普渡大学把AI写进“本科毕业条件”,校园炸锅:不会用AI,连毕业证都悬了?

美国普渡大学宣布,2026 年秋季入学新生毕业需达‘AI 工作能力’指标。校方称此非教学改革,是因就业压力,AI 能力成生存技能。该要求分五个方向,各学院依学科定标准,教师支持但忧执行。

AI科技大本营
新闻资讯8

DeepMind发布SIMA 2!打通「感知-推理-行动-反思」闭环

DeepMind推出的SIMA 2,可让智能体在虚拟环境中边聊天边进行复杂多模态推理。它整合Gemini能力,从指令执行者变为互动伙伴,有强大迁移泛化与自我提升能力,是迈向AGI重要一步,但也面临一些挑战。

新智元
新闻资讯7

最新实测GPT-5-Codex:前端能力碾压,复杂项目轻松搞定,Claude可以扔了!

OpenAI发布GPT-5-Codex,网友称可告别Claude Code。实测其前端能力提升大,能轻松完成复杂项目,如一键生成小游戏、手稿直出网页等。虽有页面UI堆叠小瑕疵,但仍值得支持。此外,Grok 4有突破,马斯克看好Grok 5。

新智元
开源动态8

中国科大Science-Star(科星) : 一体化、可扩展的科学智能体搭建平台

中科大认知智能全国重点实验室开发了 Science - Star 科研智能体平台。它基于 ReAct 引擎,有一体化可视化支持、插拔式模块化架构和跨学科工具集成等特色,为科研智能体研发与实验提供高效基础设施。

PaperAgent