「测试时路由框架」共找到 3161 篇相关文章
刚刚,阿里旗舰模型Qwen3-Max-Thinking发布,编程能力“踢馆”Gemini与Claude
阿里发布旗舰模型Qwen3-Max-Thinking,总参数超1万亿,在多项权威基准测试中表现优异,可与顶级闭源模型竞争。千问团队为其引入两项核心创新,提升推理性能,该模型已可免费体验。
第九章 编码 Agent 实战——用 Deep Agents 构建代码审查助手
文章围绕用 `deepagents` 框架构建代码审查 Agent 展开。介绍 `deepagents` 核心能力、安装配置,给出最小可运行示例。还阐述自定义工具及使用方法,添加审查 Skill 明确审查标准和流程。
ICLR 2026 | Rebuttal 是一场「带着镣铐的舞蹈」?港科 RebuttalAgent 用心智理论「读懂」审稿人
香港科技大学研究团队提出 RebuttalAgent 框架,将心智理论引入学术 Rebuttal 任务。它通过 TSR 框架拆解任务,先‘读心’再‘落笔’,能生成有说服力回复,还可作为‘思维外挂’提升小模型表现。
端到端GUI智能体首次实现“犯错-反思-修正”闭环,模拟人类认知全过程
南洋理工大学MMLab团队提出框架GUI - Reflection,让端到端多模态GUI智能体有“自我反思”能力。它在各训练阶段引入“反思与纠错”机制,实验证明该框架能提升智能体能力。
MCP客户端调用看这一篇就够了(Java版)
文章介绍MCP客户端调用方法,先阐述没MCP时的痛点,再讲大模型调用MCP的姿势,包括Spring - AI和Spring - AI - Alibaba框架的使用,还介绍原生SDK调用方式,记录踩坑问题,探讨两种技术路线的选型。
30 小时不眠不休写代码,Claude 4.5 的三个“最佳”
Anthropic发布Claude Sonnet 4.5,宣称其为“世界上最好的编码模型”等。它在测试中表现出色,能力全面提升,价格实惠,开发者测试效果佳。还注重安全,升级开发工具和生态系统。
Pinterest 工程通过运行时感知分片将 Android CI 构建时间缩短了 36%
Pinterest 发布技术案例研究,介绍工程团队通过运行时感知的测试分片策略和内部测试平台,将 Android CI 构建时间缩短超 36%,还对比了其他公司提升 CI 性能的做法。
不安全指令,一拒了之?TRIAD用三路决策:修复AI智能体的危险计划
墨尔本大学团队开源TRIAD框架,将传统二元护栏决策扩展为继续、更新、拒绝三类。通过自然语言反馈引导Agent修正计划,在ASB和AgentHarm评测中,显著降低攻击成功率,提升正常任务完成率。
想清楚再动手:具身智能也要学会脑补未来和择优执行 | RSS 2025
近年来基础模型在具身智能领域能力惊人,但在真实部署中常‘用不好’。卡耐基梅隆大学与伯克利人工智能研究院团队提出 FOREWARN 框架,结合‘世界模型’与‘多模态语言推理’,解决部署智能难题。
音频大模型安全可信度的全面“体检”!6大维度,清华南洋理工联手打造
南洋理工和清华团队提出新框架AudioTrust,将ALLMs评估扩至六个核心维度,探究音频模态特有问题。目前基准及平台已开发,揭示了开源与闭源ALLMs在多维度的潜在风险。