黑盒测试框架」共找到 3137 篇相关文章

开源动态7

走出 MMLU 的高分幻觉:AI Agent 的「斯坦利时刻」与职场生存法则

文章指出多模态大模型在基准测试分数高,在实际业务流程却像‘职场巨婴’。研究团队构建Trainee - Bench测试顶尖模型,结果显示模型离‘独立上岗’远,凸显提升Agent自主学习性的重要性。

AI科技评论
新闻资讯7

Grok 4 突然自称希特勒,遭Anthropic 研究员指责不守规矩、不顾安全

Grok 4 Heavy被发现回答姓氏为「希特勒」,普通版Grok 4正常。研究员推测其受过去错误影响,对发布前测试构成挑战。Anthropic研究员批评xAI发布Grok 4无安全测试文档,引发行业争论。

AGI Hunt
算法论文7

AI没有创造力吗?结构性约束与跨模态张力涌现AI创造力

法国索邦大学研究成果揭开AI创造力从受限领域生成模型中涌现的事实。研究转换视角关注生成过程结构条件,提出含四维度的概念框架解构创造力,通过实验证明多模态约束能催生AI新颖形式。

AIGC开放社区
新闻资讯7

从性能到实战,怎样才算是靠谱的 Agent 产品?

红杉中国团队提出AI基准测试工具Xbench,其双轨测评体系不再单纯执着于测评问题难度,重点量化AI系统在真实场景的效用价值,还构建长青评估机制,以确保评估结果的时效性和相关性。

机器之心
推荐文章7

上海交大/上海AI Lab翟广涛:当评测不再重要,AGI就实现了

上海交通大学教授翟广涛认为完美的AI评测体系等同于通用人工智能。当下评测体系存在数据污染、原子化能力评测局限等问题,他主张回归‘以人为本’,团队提出相关框架和技术路径,目标是训评一体。

机器之心
算法论文8

ICCV 2025|降低扩散模型中的时空冗余,上交大EEdit实现免训练图像编辑加速

上海交通大学EPIC Lab团队提出EEdit框架,入选ICCV 2025。它是首个加速匹配流模型图像编辑框架,能兼容多种引导方案,免训练,速度较原始工作流快2.4倍,支持多类型编辑任务。

机器之心
算法论文8

多模态推理最高加速3.2倍!华为诺亚新算法入选NeurIPS 2025

华为诺亚方舟实验室研究入选NeurIPS 2025,其提出视觉感知投机推理(ViSpec)框架,解决草稿模型处理图像信息效率难题,在不牺牲生成质量下,对主流VLM最高达3.22倍推理加速。

量子位
算法论文8

世界首个!李飞飞团队推出物理推理基准,大模型统统不及格?

斯坦福联合中科大团队推出世界首个评估视觉语言模型物理推理能力的基准QuantiPhy,通过测试发现顶尖模型在数值计算上不如人类,还揭示模型推理靠记忆而非测量,为AI发展指明方向。

AIGC开放社区
算法论文8

Tool-Star:赋予大模型结合多工具推理的能力

文章提出Tool - Star框架,旨在解决大模型多工具协作推理难题。它从数据端到训练流程优化,让模型调用多种工具,在复杂计算和知识型推理任务表现卓越,还探讨了未来多模态及多工具扩展方向。

PaperAgent
新闻资讯7

OpenAI推迟开源大模型发布

OpenAI联合创始人兼CEO Sam Altman宣布本周不发布开源模型,因需更多安全测试。他曾透露要推可下载、自主运行且能力强的开源模型,此前6月也因安全测试推迟发布。

AIGC开放社区