「测试时强化学习」共找到 2992 篇相关文章
Google刚刚开源的一款AI工具,Gemini 2.5驱动浏览器自动化!
Google在GitHub开源AI浏览器自动化工具Computer Use Preview,基于Gemini 2.5模型,用自然语言控制浏览器完成复杂任务。支持双环境,集成Gemini API/Vertex AI,适用于Web测试等,零代码入门。
YC总结的vibecoding核心指南「如何充分利用Vibecoding 」
顶尖孵化器 Y Combinator 总结了 vibecoding 核心指南,涵盖规划流程、版本控制、测试框架等多方面内容,为开发者提供了利用 AI 进行开发的实用策略和方法。
最新研究!大模型“角色扮演”无效了?
沃顿商学院研究测试6个主流AI模型,进行超25000次测试,发现告诉AI扮演专家角色,不会让其回答更准确,反向设定‘低知识’角色有时表现更好,角色扮演不是提高准确性的万能钥匙。
全球首个历史基准!普林复旦打造AI历史助手,AI破圈人文学科
普林斯顿大学AI实验室与复旦大学历史学系联手推出全球首个历史领域评测基准HistBench及AI助手HistAgent。HistBench含414道题,能检验AI深度认知能力;HistAgent集成多种工具,在测试中表现优异。
华为推出软工代码智能体SWE-Lego,解锁SFT训练极致性能
华为研究团队推出仅基于监督微调(SFT)的软件工程代码智能体SWE-Lego,无需复杂RL流程,在SWE-bench Verified基准中表现出色,项目已开源。它有数据、训练和测试时扩展三大创新。
刚刚,阿里旗舰模型Qwen3-Max-Thinking发布,编程能力“踢馆”Gemini与Claude
阿里发布旗舰模型Qwen3-Max-Thinking,总参数超1万亿,在多项权威基准测试中表现优异,可与顶级闭源模型竞争。千问团队为其引入两项核心创新,提升推理性能,该模型已可免费体验。
为什么自监督永远学不到语义?
《Visual Language Hypothesis》论文用纤维丛理论审视视觉表征学习,指出只做连续变换难触达语义。分析现有无监督学习不足,提出“Expand - and - Snap”机制,还通过实验验证,提供审视AI架构新视角。
30 小时不眠不休写代码,Claude 4.5 的三个“最佳”
Anthropic发布Claude Sonnet 4.5,宣称其为“世界上最好的编码模型”等。它在测试中表现出色,能力全面提升,价格实惠,开发者测试效果佳。还注重安全,升级开发工具和生态系统。
52k Star,Hermes Agent试图杀死OpenClaw
近期龙虾(OpenClaw)热度下降,harmess engineering大火。开源项目hermes-agent已有52.7k Star,是自学习型AI智能体,能积累技能、持续学习,可轻松切换多种模型,还给出安装、使用指南和文档教程。
吴恩达来信:人工智能工程技能地图
吴恩达团队综合整理AI工程技能地图,助开发者确定学习方向和雇主招聘。四项重要技能为构建和部署AI应用、软件工程基础、使用编程智能体、塑造构建,背后需持续学习心态。