工作成果验证」共找到 2366 篇相关文章

新闻资讯7

Claude 4如何思考?资深研究员回应:RLHF范式已过,RLVR已在编程/数学得到验证

Anthropic两位研究员在博客采访中透露Claude 4思考细节。提到可验证奖励强化学习RLVR在编程和数学领域获证明,探讨了RL扩展、模型自我意识等,还为大学生给出AI领域建议。

量子位
新闻资讯7

Claude Code 一小时「复刻」谷歌一年成果,那一年能读完五年半的博士吗?

X博主Yuchen Jin感慨读博时若有AI工具,一年就能毕业。谷歌工程师称Claude Code一小时成果抵谷歌一年。网友对AI工具在工作积极认可,但在教育作用上看法不一,争论持续。

机器之心
产品应用8

用了飞书aily新功能,我终于理解什么叫“AI不是聊天,是干活”

作者黄叔体验飞书 aily 工作助手的“任务模式”后赞不绝口。该模式能异步工作、深度结合飞书生态,可像数字员工一样交付多种成果,如竞品报告、网页、海报、播客等,虽有不足但非常实用。

AI产品黄叔
算法论文8

Anthropic 在 Claude 内部发现"全局工作空间",可以直接读取模型没说出口的想法

Anthropic发布研究,在Claude内部发现J - space(雅可比空间),即“全局工作空间”,它在训练中自发形成。用雅可比透镜技术可读取其内容,还验证了其功能属性,可用于对齐审计等。

AI工程化
产品应用8

智谱GLM-5.1深度评测:8小时连续工作,开源大模型进入"工程交付"新纪元

2026年4月8日智谱发布GLM-5.1,它是全球首个通过真实工程任务验证8小时持续工作能力的开源模型,在SWE-Bench Pro上超越GPT-5.4等登顶。该模型性价比高、技术创新多,还适配国产硬件,开源生态友好。

机器学习AI算法工程
推荐文章8

对话涌生智能杨梦:AI for Bio的下一场竞争,是把实验闭环验证真正做出来

随着科技巨头进入生命科学领域,AI for Bio竞争升级,焦点转向模型能否进入科研流程。涌生智能与上海人工智能实验室发布成果,为跨越鸿沟提供新路径。对话涌生智能杨梦,探讨相关技术路径、产业思考等。

DeepTech深科技
算法论文8

无需验证器的RL:RLPR解锁LLM通用推理潜能

现有依赖强化学习与可验证奖励(RLVR)提升大语言模型(LLM)推理能力的方法,受限于领域特定验证器。本文提出RLPR框架,利用LLM生成正确答案的固有概率作奖励信号,实现无需外部验证器的通用领域强化学习,效果显著。

深度学习自然语言处理
算法论文8

超越Claude Mythos和GPT-5.5!斯坦福Agent验证框架拿下SOTA,Transformer作者转发

斯坦福、伯克利与英伟达联手打造LLM-as-a-Verifier验证框架,该方法是通用验证机制,可与任意Agent Harness和模型结合。研究表明扩展验证阶段计算量,能提升Agent整体性能,在多基准测试中超越Claude Mythos和GPT - 5.5。

量子位
新闻资讯7

Andrej Karpathy 提出判断什么工作会被 AI 替代的新标准

Andrej Karpathy 提出判断工作是否会被 AI 替代的新标准,即不看复杂度看可验证性。他在 Software 2.0 框架下解释此现象,还指出任务被 AI 自动化需满足可重置、高效、可奖励三个条件,同时提及该框架有局限性。

AI工程化
推荐文章7

AI 炮制的“工作垃圾”,正在摧毁你的生产力

尽管生成式AI在工作场所使用激增,但多数公司难见可衡量的投资回报率。原因可能是AI工具产出“工作垃圾”,表面光鲜却空洞。文章分析现象、影响,并为组织提出避免“一刀切”等应对原则。

宝玉AI