「测试成绩」共找到 1897 篇相关文章
答对了却没看图?EASE给多模态RLVR装上「视线校正器」
强化学习与可验证奖励提升视觉语言模型推理能力,但存在答案奖励只知对错、不知证据区域问题。哈工大等团队提出EASE,把标注证据区转为目标分布,监督空间注意力,推理无额外标注,实验成绩优异。
2个设置,让Codex体验翻倍
文章分享两个提升Codex使用体验的技巧。一是在config.toml里添加配置,让非计划模式能主动提问;二是用特定提示词测试gpt的juice值,选正常思考程度的模型使用,提升使用心情。
1周半写64个PR、完成30%项目重构:一家成熟SaaS公司把Agent塞进研发全流程后
Calendly公开Agentic Engineering实践,Agent嵌入研发全流程,如审查需求、写代码、测试等。一周半内,Agent为IAM团队生成64个PR,完成30%项目重构。研发瓶颈从写代码转为判断力,强调好需求与护栏重要性。
VC开始靠AI预测未来了
七月,DigClaw的预测框架Rhizome v1在FutureX评测平台取得优异成绩,支持了预测能力可沉淀在基座模型之外的判断。大语言模型不擅长预测,而DigClaw构建了以因果结构为骨架的预测基础设施。
The Batch: 968 | Muse Code 想获取你的数据
Meta推出Muse Code编码框架及Muse Spark 1.2模型,有不同输入输出、功能和性能表现。提供不同档位价格,贡献者档位低价但数据用于训练。测试显示其单任务成本低,Meta此举或为获取编码训练数据。
Zig 创始人直言,Bun 靠 Claude 生成的 Rust 重构版是“没人把关的烂代码”
Bun创建者用Claude智能体11天将Bun从Zig移植到Rust,虽通过测试,但Zig创始人Andrew Kelley批评其编程实践不规范,认为代码是‘没人把关的烂代码’,且AI生成代码缺监督会出问题。
2026 Data+AI 中场纪实:企业决策者,敢把真实业务交给 Agent 吗?| 直播预告
Snowflake携手InfoQ发起直播,探讨企业将真实业务交予Agent的问题。贾天下将分享相关内容,其博客展示有本体团队可实现的能力,还通过生物医学基准测试比较不同方案,为构建企业级AI智能体提供参考。
人类研发时代结束?XYZ最强Search Agent横扫七大榜单,300个Agent跑通AI4AI全栈闭环
近日,XYZAI Lab发布两款Deep Search Agent,刷新多项评测SOTA成绩。其背后是新型AI4AI研发范式,让AI驱动研发闭环。XYZ团队用AI解决多方面问题,在Deep Search验证,未来有望拓展更多场景。
阿里Qwen 3.7 Max:35小时自主编程,Claude跟不上了?
阿里云峰会发布的Qwen 3.7 Max,在优化平头哥芯片推理内核任务中,35小时让推理速度快10倍。它在多基准表现出色,编程、推理、办公自动化全面开花,但闭源且实验室场景与现实有差距。
首个语音智能体端到端测评出炉:Grok登顶,真实场景通过率仅一半
Artificial Analysis推出业内首个语音转语音智能体端到端性能基准τ - Voice,测试真实客服场景能力。结果显示最强S2S模型成功率刚过一半,Grok Voice Think Fast 1.0夺冠,但也面临诸多质疑。