「智源大会」共找到 6036 篇相关文章

算法论文8

新SoTA方法RM-R1:让reward model对评分说出原因!超越GPT4o

过去模型‘黑箱打分’不透明、不灵活。论文提出ReasRM,经两阶段训练,让奖励模型像人类先思考再打分。它能分任务类型、动态奖励,实验中碾压GPT - 4,小模型逆袭,团队已开源6个模型。

深度学习自然语言处理
推荐文章9

从 Jev 到 TierSense, Agent 的「判断层」正在被拆出来 | GAIR Paper 132

本文解读Jev和TierSense项目,提出将Agent判断层从大模型生成中拆分,交给专用轻量模型,介绍TierSense能力、实验数据,探讨专用判断模型优化Agent效率的新方向。

AI科技评论
新闻资讯8

刚刚,SpaceXAI最强Grok 4.7发布!价格杀疯,跑分令人失望

本文报道SpaceXAI发布新款大模型Grok 4.7,该模型定位面向编程与知识工作,主打速度翻倍、价格仅为同类一半,强化长任务处理能力,跑分表现引发网友争议。

机器之心
推荐文章8

阶跃Step 5 Preview没赢GPT,但反而更好用了

本文作者实测600B参数量的阶跃Step 5 Preview大模型,从写码、幻觉控制、写作三个维度,对比GPT及其他国产头部模型,分享无滤镜真实体验,给出选型参考。

探索AGI
推荐文章9

深度|AI开始接管物理世界,谁来掌握新的入口?

本文为深度行业分析,围绕Anthropic推出的模型硬件标准MHS展开,探讨AI从虚拟屏幕切入真实物理世界、接入实验设备的产业进程,梳理核心挑战与未来竞争格局。

DeepTech深科技
新闻资讯7

AI Infra 正在诞生自己的石油期货?GPU 不够买之后,华尔街开始交易算力

AI 行业焦点从 GPU 够不够用转向算力定价。2026 年 8 月 CFTC 就算力衍生品公开征求意见,CME 与 Silicon Data 计划推期货产品。但 GPU 算力金融化面临标准化、衡量方式等难题。

InfoQ
算法论文8

登上Science Robotics顶刊!清华团队耗时22年,终于教会机器人踢足球

今年8月,清华赵明国教授团队联合字节跳动Seed等在《Science Robotics》发表论文,提出视觉驱动的反应式足球技能学习框架。该研究历经22年技术接力,成果在真机和赛事中验证,加速进化平台助力研究。

机器之心
推荐文章7

Anthropic:现在学习FDE,年薪百万!

Anthropic大佬分享FDE岗位价值,指出其非外包,是面向客户的软件工程师。还阐述适合的人才、团队,纠正三大误区,强调客户买的是解决问题的过程,现场沟通能力正升值。

探索AGI
开源动态8

世界模型评测的最大盲区,被这个新基准捅破了

过去一年,‘世界模型’成视频生成领域热词,厂商强调产品要模拟真实世界运行规律,但业界评测一直未能精准检验其‘物体恒存’的认知能力。为此,研究者提出新基准MemoBench,测试了主流模型,揭示其短板。

机器之心
推荐文章7

2026年必须搞懂的20个 Agent 工程概念(运行机制篇):大白话一次讲清。

文章聚焦Agent工程运行机制,介绍20个核心概念。如Agent与ChatBot区别在于会‘做’;Harness是模型运行框架;Execution Model决定思考行动范式等,还给出各概念工程实践建议。

AI大模型应用实践