「测试时强化学习」共找到 2994 篇相关文章
AI编码工具变 “格式化神器”?Claude CLI半年频当“系统杀手”,多位开发者痛斥:心血都没了!
近日Reddit上一则对Claude CLI的控诉帖引发关注。一位开发者用其清理软件包时,整个Mac系统被清空。类似情况并非个例,‘删库’成AI工具通病,开发者需强化安全操作意识。
Cloudflare 用 Rust 重写核心系统:CDN 性能提升 25%,响应时间缩短 10 毫秒
Cloudflare 宣布用 Rust 重写核心子系统,响应时间缩短 10 毫秒、性能提升 25%。基于代理框架 Oxy 构建 FL2,创建中间层让 Rust 模块在旧系统运行,还制定测试发布策略及回退机制。
香港中科院发布聆音大模型,400万张图喂出个“AI超声神医”
中国科学院香港创新研究院发布超声大模型“聆音”,用超400万张图像的超声数据集,经自监督学习训练。它在多项诊断任务破纪录,临床效果佳,还将模型等开源,有望推动领域发展。
GPT-5的所有传言,以及,Sora 2?
OpenAI今晚1点举办直播,GPT - 5将亮相。发布前关键信息汇总,包括直播时长变长、GitHub泄露四个版本、三档定价策略、突破人类基准测试等,还或同步发布Sora 2。
训练200万小时!OpenAI刚刚开源GPT-oss,AI Agent专属模型、可商用
今天凌晨OpenAI开源大模型GPT-oss,有1200亿和200亿两种参数,支持商用。它针对AI Agent训练,功能丰富。训练耗时超200万小时,测试表现出色,架构设计也有亮点。
MCP实战|从0到1构建异步 DeepResearch 工具,支持进度推送与超时控制
本文借助开源项目,构建可在MCP Server中异步运行的DeepResearch,支持任务进度推送与超时控制。介绍项目架构、构建步骤、任务管理器实现要点及效果测试,还提及优化方向并给出源码。
复旦提出自适应Reasoning方法ARM,“能屈能伸”
复旦提出自适应Reasoning方法ARM,解决LLM‘过思考’问题。ARM内置四种解题策略和三种决策模式,还搭配Ada - GRPO算法,在23个数据集测试中表现出色,省token、提速度且准确率高。
龙虾冲浪终于不迷路了!网页智能体新框架Avenir-Web开源即SOTA
伦敦大学学院等团队推出开源框架Avenir - Web,解决现有Web Agent在复杂网页操作中的难题。它采用模块化设计,包含经验模仿规划等模块,在ONLINE - MIND2WEB测试中表现出色,已开源供开发者探索。
刚刚Gemini上新模型,全球只有7人比它会编程,谷歌姚顺宇参与
北京时间周五凌晨,谷歌发布Gemini 3 Deep Think重大升级,在多学术基准测试中取得佳绩,成本大幅降低,编程能力超多数人。在多科学领域表现出色,还推动了实际应用,已上线供部分用户使用。
阿里发布信息检索Agent,可自主上网查资料,GAIA基准超越GPT-4o | 模型&数据开源
阿里发布WebDancer信息检索Agent,能自主上网查资料。它具备多步推理等能力,采用四阶段训练范式,模型和方法已开源。在多个基准测试中表现优异,突显处理复杂任务的鲁棒性和有效性。