「测试用例生成」共找到 3678 篇相关文章
Multi-Agent记忆系统MIRIX:比RAG性能飙升35%,存储减少99.9%
现有AI Agent记忆方案有局限,MIRIX作为模块化多智能体记忆系统应运而生。它由六种记忆类型和多智能体框架组成,支持多种检索功能。在多模态和单模态测试中表现优异,为记忆增强型LLM智能体设新标准。
GitHub连续霸榜,难怪别人的图表这么高级优雅!
作者让AI画系统架构图效果不佳,朋友推荐diagram-design项目。它是给Agent用的出图技能包,能让AI生成编辑级质量图表,有多种图表类型,具备诸多亮点功能,还介绍了安装使用方法。
“如果你不能用300行代码写个Cursor,这行你就别待了!”Ralph Loop创造者、Claude Code核心技术设计者的暴论
Ralph Loop 创造者 Geoffrey Huntley 在播客称软件开发已死,任何人用 Cursor 就能生成代码。他还谈到 K 型分化下职业生存法则、Ralph Loop 设计哲学、代码审查问题,并给出学习和职业发展建议。
ICML 2026 | 北大提出的APEIRIA,打破了3D MLLM黑盒推理困境
北大团队提出面向3D空间推理的新框架APEIRIA,将神经符号程序推理模式蒸馏进3D MLLM。采用三阶段课程学习,在多基准测试表现强劲,保留模块化优势,为具身智能系统提供启发。
让离线强化学习从「局部描摹」变「全局布局」丨ICLR'26
现有生成式离线强化学习方法在复杂连续任务长程规划中易陷入局部合理但全局偏航的窘境。厦门大学和香港科技大学提出MAGE算法,采用自顶向下策略,实验显示其多任务表现出色、推理效率高。
劝视频博主别拿龙虾起号,7×24小时全自动,碳基生物真卷不过
X上网友分享的AIVideo Agent可7×24小时全自动完成视频制作流程,上手无技术难度,还能与多平台集成。AIVideo.com功能全,实测生成速度快且操作空间大,或改写传统视频生产流程。
别人在测 Demo,我已经用MiniMax M2.1跑通了整个产品开发流程
作者黄叔用自研产品「降噪」测试 MiniMax M2.1,从 Skills 优化、页面样式、沉浸式交互、智能搜索四个维度检验实战能力。结果显示 M2.1 优势明显,虽有不足,但已能满足多数日常开发任务。
刚刚,美团开源全模态龙猫模型,和 ChatGPT 大战 100 回合打得难解难分
美团发布开源全模态 MoE 模型 LongCat-Flash-Omni,参数 560B 激活 27B。它有真正全模态能力,采用创新架构和训练范式,基准测试表现亮眼,部分指标超 Gemini-2.5-Flash,引发网友热议。
推理“刹不住车”?新框架让DeepSeek-R1们告别过度思考,已开源
DeepSeek - R1等推理模型能力增强,但出现过度思考问题,如步骤繁冗、表述拖沓、输出冗长。浙大等团队提出Self - Braking Tuning(SBT)框架,能让模型适时终止推理,在多数据集测试中效果显著。
为什么伟大的 AI 产品不能被计划?
Anthropic的CPO Mike Krieger分享构建AI产品经验与哲学。他认为未来多数内容将由AI生成,判断重点在来源与可信性;伟大AI产品多自下而上生长,如MCP协议;还谈到AI应用面临易用性等问题。