测试框架」共找到 3112 篇相关文章

推荐文章7

架构师困境:选择已被验证的道路,还是自行开辟一条新路?

开发软件时,团队要做产品功能和架构决策,面临选已验证路径还是自辟新路的困境。使用平台和框架虽能加快开发,但有副作用。团队需通过实验判断何时扩展或替换平台。

InfoQ
算法论文7

好玩!AI模仿人类‘空像错觉’,开启想象力之旅

越南国立大学提出Shape2Animal框架,模仿人类‘空想性错觉’,将自然物体轮廓转化为动物图像。该框架经多阶段流程,结合多种技术生成画面,但也继承了基础模型的一些局限性。

带你学AI
算法论文8

ICLR-26腾讯混元:Agent是强大的,但用户是狂野的

现有LLM工具使用基准测试场景理想化,忽视真实用户行为复杂性。腾讯提出WildToolBench,基于真实用户行为构建测试集,对58个模型评估,发现模型准确率低,揭示LLM在真实场景下能力缺口,为模型优化指明方向。

PaperAgent
推荐文章7

如何为 GPU 提供充足存储:AI 训练中的存储性能与扩展性

文章通过分析 MLPerf Storage v2.0 测试结果,探讨不同存储系统在大规模 AI 训练中的表现。介绍三类训练负载及新的 Checkpointing 负载,分析共享文件系统类别,给出比较视角,解读各负载测试结果并总结选型要点。

InfoQ
新闻资讯7

突发!Gemini 3.8登顶,谷歌迈出RSI一大步

谷歌发布Gemini 3.8 Flash及专攻网络安全的3.8 Flash Cyber。前者性价比高,在多项测试逼近顶级模型;后者在网络安全测试屠榜。但谷歌也被指提前庆祝,且模型可能有‘刷榜’成分。

新智元
开源动态8

训练即服务!让模型训练回归算法语义,150行代码跑通RL

ModelScope团队开源Twinkle框架,采用Client - Server架构,支持20余种算法组件。开发者约150行代码就能编排复杂RL训练循环,底层调度等交给框架。它兼顾易用性与灵活性,有多种特点和优势,代码已开源。

量子位
开源动态7

谷歌开源的 Gemini CLI 扩展助力开发者构建定制化人工智能工作流

谷歌发布开源的 Gemini CLI 扩展框架,引入‘剧本’概念,可让 AI 与外部工具交互。框架增强了 Gemini CLI 功能,支持多组件。谷歌构建开放生态,还为开发者提供模板和指南,其在 AI 驱动 CLI 领域有独特优势。

InfoQ
算法论文8

今年看到最系统的AI Agents时代Memory综述~

分享由NUS、人大等联合出品的《Memory in the Age of AI Agents: A Survey》。用三维框架讲透200+篇论文,提出新三大记忆形态,展望7大前沿,还涵盖记忆各方面知识及资源。

PaperAgent
新闻资讯3

马斯克Grok 4正式发布:世界最大AI超级计算机就训练了这?

Grok 4公开基准测试有进步,但在高级推理测试表现差,视觉理解仍是短板。性能提升多靠整合符号工具,无重大技术创新,‘幻觉’问题没实质进展,xAI官方对道德对齐信心不足。

AI寒武纪
算法论文8

上海交大团队发布首篇「搜索智能体」综述!四个维度深度剖析搜索智能体

上海交大团队发布首篇「搜索智能体」综述,从如何搜索、优化、应用、评估四个维度剖析。随着LLM兴起,搜索从传统模式向搜索智能体转变,虽有潜力但缺统一研究视角与评估框架,该综述提供了路线图。

AI科技评论