「测试方法」共找到 3042 篇相关文章
mcp-feedback-enhanced:一个让 Cursor 500 次额度膨胀N 倍的骚气 MCP!一次请求变成 N 次!
Cursor每月500次请求额度常不够用,网友分享“咒语”利用其工具调用功能让一次请求变多次。mcp-feedback-enhanced这个MCP工具能将多次交互合并到一次请求,还介绍了使用、安装配置及持续调用优化方法。
The Batch: 964 | Claude 亮相另一款 Opus
Anthropic发布Claude Opus 5,这是款视觉 - 语言模型,运行成本低,多任务表现优于Claude Fable 5。它在多项测试中领先,解决了Fable 5的一些问题,但也有易产生幻觉等不足。
JustGRPO:扩散语言模型的极简主义回归
本文提出回归极简的方法 JustGRPO,在 RL 阶段让模型自回归生成,用标准 GRPO 训练,能超越各类针对 dLLM 设计的 RL 算法表现,提升推理表现同时保留并行解码能力。
浙大彭思达团队 × 理想最新研究:直面高分辨率深度的细节缺失
现有高分辨率深度估计方法在实际使用中存在局限,浙江大学彭思达团队联合理想研究团队提出论文《InfiniDepth: Arbitrary-Resolution and Fine-Grained Depth Estimation with Neural Implicit Fields》,构建实验验证了InfiniDepth在多方面的有效性。
“交互式Scaling”:增加Agent与环境交互的深度和频率来提升性能
在AI发展中,商业研究Agent是“黑箱”,开源研究Agent性能有差距。MiroMind团队推出MiroThinker v1.0,提出“交互扩展”提升性能,在多基准测试表现出色,也指出了当前版本的局限。
WithAnyone重磅开源:这可能是你见过最自然的AI合照模型
复旦大学携手阶跃星辰推出全新AI合照生成模型WithAnyone,它能生成自然、真实、毫无违和感的AI合照。该模型打破以往方法局限,当前ComfyUI版本已上线,还全面开源代码、模型权重等。
通义实验室大火的 WebAgent 续作:全开源模型方案超过GPT4.1 , 收获开源SOTA
WebAgent续作《WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization》提出对information-seeking任务形式化建模,设计训练数据合成方法,全开源模型方案在GAIA评测获SOTA表现,还补足了训练数据不足问题。
Anthropic发布循环设计指南:权威拆解当下最火的AI新范式loop
Claude Code团队明确loop定义,将其分四大类,给出选择循环及控制Token消耗的实用指南,还介绍保持代码质量方法,最后总结各循环适用场景、建议功能,指导用户开始使用。
Gemini 3.1 Flash-Lite Preview发布:Google完成AI模型分层布局
Google发布Gemini 3.1 Flash-Lite Preview,针对企业和开发者场景优化,速度快,有‘思考级别’功能。基准测试表现不错,价格比Claude 4.5 Haiku便宜,但开发者社区反应复杂,面临市场定位问题。
我给 Claude Code 加装了 MiniMax M2.5:它像“法拉利”,但更像一台工作机
作者给 Claude Code 加装 MiniMax M2.5 模型,测试其编程、上下文记忆等能力。M2.5 在多方面表现出色,能高效完成各类开发任务,还具备良好的中文处理能力,性价比高。