测试范式」共找到 2589 篇相关文章

算法论文8

Multi-Agent记忆系统MIRIX:比RAG性能飙升35%,存储减少99.9%

现有AI Agent记忆方案有局限,MIRIX作为模块化多智能体记忆系统应运而生。它由六种记忆类型和多智能体框架组成,支持多种检索功能。在多模态和单模态测试中表现优异,为记忆增强型LLM智能体设新标准。

PaperAgent
算法论文8

ICML 2026 | 北大提出的APEIRIA,打破了3D MLLM黑盒推理困境

北大团队提出面向3D空间推理的新框架APEIRIA,将神经符号程序推理模式蒸馏进3D MLLM。采用三阶段课程学习,在多基准测试表现强劲,保留模块化优势,为具身智能系统提供启发。

机器之心
算法论文8

刷榜多元时序预测,性能波动0%!打破CI/CD二元对立 | ICLR'26

在多元时间序列预测领域,长期存在通道依赖(CD)与通道独立(CI)路线之争。浙江财经大学团队提出CPiRi框架,结合时空解耦架构与置换不变正则化策略,解决范式矛盾,取得优异效果。

新智元
新闻资讯8

LangChain 创始人警告:2026 成为“Agent 工程”分水岭,传统软件公司的生存考验开始了

LangChain 创始人 Harrison Chase 认为 2025 年末到 2026 年长任务 Agent 落地会加速,传统软件公司面临挑战。他指出构建 Agent 工程范式在变,还分享了 Agent 应用案例、harness 工程要点、开发与传统软件的差异等内容。

InfoQ
产品应用8

别人在测 Demo,我已经用MiniMax M2.1跑通了整个产品开发流程

作者黄叔用自研产品「降噪」测试 MiniMax M2.1,从 Skills 优化、页面样式、沉浸式交互、智能搜索四个维度检验实战能力。结果显示 M2.1 优势明显,虽有不足,但已能满足多数日常开发任务。

AI产品黄叔
产品应用8

搜攻略到凌晨3点?飞猪AI“问一问”用1张表谋杀废话

作者用旅游方案提示词测试各类Agent产品,多输出废话。飞猪“问一问”旅行Agent却很厉害,能生成实用旅行规划,还给出汇总表格、地图、行程卡片等,考虑全面且细节丰富,还能找特价机票。

歸藏的AI工具箱
开源动态8

阿里开源长文本深度思考模型!渐进式强化学习破解长文本训练难题,登HuggingFace热榜

阿里开源长文本深度思考模型QwenLong - L1,登上HuggingFace热门论文第二。它解决了长文本强化学习训练难题,通过渐进式上下文扩展训练,在多基准测试中表现出色,还探讨了SFT和RL作用。

量子位
开源动态8

狂揽33.8K星!这款Postman替代工具,绝了,离线+Git协作太香

Bruno是开源API探索测试IDE,有自研Bru语言、离线存储和Git协作能力,是Postman等强力竞争者。它功能丰富,有跨平台支持等,技术架构优势明显,还给出实战演示和同类工具对比。

小华同学ai
开源动态8

腾讯Hy3正式版亮相,幻觉率更低,Agent能力更强

7月6日腾讯Hy3正式版上线并开源,总参数量295B。它幻觉率从12.5%降至5.4%,Agent能力大幅提升,在生产力场景表现出色,基准测试结果良好,价格有优势,腾讯内部9条线已接入。

AIGC开放社区
推荐文章8

AI越用越聪明,自主+自进化是关键拼图丨盛大邓亚峰EverMind@AIGC2026

在AIGC2026峰会上,盛大集团邓亚峰指出,AI范式从Chat转向Agent,未来AI需“自主”与“自进化”,长期记忆是关键。EverMind团队基于此研发相关技术,成果显著,还提出个人记忆主权等观点。

量子位