「测试时深思」共找到 2297 篇相关文章
未来1-5年半数白领或失业?Anthropic联创自曝:内部工程师已不写代码,下一代AI大多是Claude自己写的
在2025年Axios AI+华盛顿峰会上,Anthropic联创接受访谈,称未来1到5年,多达一半白领工作或消失,失业率或飙升至20%。Anthropic内部工程师工作已巨变,Claude能自写代码设计下一代AI。此外,AI还出现作弊等情况。
Claude Sonnet 4.5被炸出来了,依旧最强编程,连续30小时自主运行写代码
新发布的Claude Sonnet 4.5在SWE - bench等多项测试中成绩提升,能连续30小时自主写代码,还改善了对齐和安全性指标,且提质不加价。此外,Anthropic官宣Claude Agent SDK,发布Imagine with Claude功能。
刚刚,LeCun团队开源首款代码世界模型!能像程序员一样思考的LLM来了
Meta官宣发布代码世界模型CWM,将世界模型引入代码生成任务。它基于编程和世界建模数据训练,能模拟程序执行与交互。在编程基准测试中表现不错,算是Meta的概念验证,目前可看作Demo。
自动生成n8n工作流!这个神级开源方案,绝了~
文章分享全自动构建n8n工作流的方案,核心是开源项目n8n - mcp,它是AI Agent的n8n外挂知识库,能让AI深度理解和使用n8n。文中介绍其安装、使用,还展示不同难度案例的生成效果。
搜狐架构演进技术实践:我们如何用 MCP Registry 根治 AI Agent 的“千具之灾”
本文讲述搜狐团队在构建企业级 AI Agent 时遭遇‘千具之灾’,当前路由模型方案引发‘治理噩梦’。后通过研究 MCP Registry 获新思路,设计新架构,构建 PoC 原型,并对混合路由等问题展开思考。
突破后训练瓶颈?Meta超级智能实验室又一力作:CaT解决RL监督难题
AI后训练依赖监督微调或程序化检查器,但很多有价值任务缺这两种资源。Meta超级智能实验室等机构研究者提出CaT方法,把推理时额外计算当教师信号,为大模型提供监督,实验显示效果显著。
Scaling Law再现Agent领域!阿里提出训练新范式:在预训练和后训练之间还需一个Agentic CPT
近年来,大型语言模型向智能体系统进化。但当前主流方法构建智能体不佳,阿里通义实验室团队论文提出智能体持续预训练(Agentic CPT)新范式,开发AgentFounder模型,在多基准测试表现卓越。
全国首部AI智能体应用评估标准,现公开征集起草单位和个人!
2025年成AI智能体元年,市场规模将达113亿美元。但企业部署时面临‘效能黑箱’,缺乏评估规范。智合标准中心发起《企业级AI智能体应用效能评估规范》团体标准起草,现征集起草单位和个人。
揭秘腾讯内部科研组织ARC Lab:找最好的人才,做最难的事情
文章揭秘腾讯ARC Lab,它在行业低谷时创立,坚持找最好人才、做最难之事。介绍运营机制,如小团队、技术影响力漏斗、绩效体系等,还阐述其在学术、行业、业务、社会和人才方面的影响力。
GPT-5:前端开发者的“选择自己的冒险路线”
OpenAI 称 GPT - 5 在前端编码出色,内部测试 70% 时间胜 OpenAI o3,获 Vercel 支持。但部分开发者看法不一,有人体验变差,也有人认为它表现一般,还探讨了其让开发者绕开 React 的可能。