工业基准」共找到 1054 篇相关文章

算法论文8

用「进化+压力测试」自动生成的竞赛级编程题,各家大模型谁更hold住?

北京大学与通用人工智能研究院联合提出 UniCode 框架,构建进化式评测系统,能自动生成高质量算法题目与抗污染测试用例。通过对 19 个前沿大模型测试,展现高挑战性与强判别力,为代码能力评估开辟新路径。

机器之心
算法论文8

「重要性采样」并不「重要」?快手清华ASPO攻克重要性采样权重错配

快手与清华合作团队发现大语言模型结果监督强化学习中,重要性采样机制“失灵”,存在权重错配现象。为此提出算法ASPO,在多基准测试中展现优势,训练更稳定。

量子位
算法论文8

AI在实时视频里秒“剪”出你想要的部分!输入文字/图/视频片段,它都能秒懂|ICCV2025

最新混合模态在线视频定位技术OVG - HQ开挂了!它能根据文字、图、视频片段等线索,在实时视频流中精准裁剪出关心的事件,已收录于ICCV2025,破局以往技术“离线”“词穷”缺陷。

量子位
开源动态8

腾讯混元开源AI绘画新框架:24维度对齐人类意图,让AI读懂复杂指令

腾讯混元团队开源PromptEnhancer框架,通过“思维链提示重写”提升AI绘画文本 - 图像对齐精度,复杂场景准确率提升17%以上。还开源高质量基准测试数据集,为研究提供支撑。

量子位
算法论文8

GUI 精准定位新 SoTA:LASER 让模型从“看全图”走向“锁重点”

多模态大模型在高分辨率、元素密集的 GUI 场景易误判。苏州大学 OpenNLG 团队提出 LASER 方法,让模型学会主动推理,通过关键区域聚焦等提升定位精度,在基准测试中表现出色。

深度学习自然语言处理
新闻资讯7

Salesforce 最新研究:LLM 智能体 CRM 测试成功率低至 35%,保密意识还低,企业敢用吗?

Salesforce AI 研究团队新基准测试显示,LLM 智能体在 CRM 测试中表现欠佳,单步任务成功率约 58%,多步任务降至 35%,且保密意识低,与企业需求差距大。

InfoQ
产品应用8

Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线

Anthropic发布Fable 5.1和Mythos 5.1,8项基准测试夺冠,价格最高降45%。展示科研成果,如蛋白质设计、生成金星地图等。上线反蒸馏机制,防止篡改上下文,还给出替代方案。

量子位
新闻资讯7

The Batch: 972|Grok 的 Cursor 联盟获得回报

SpaceXAI发布与Cursor联合开发的视觉 - 语言模型Grok 4.6,已向开发者开放。介绍其输入/输出、特性等信息,阐述工作原理、性能表现,还提及相关新闻背景、重要原因及期望。

DeeplearningAI
算法论文8

WWW'26 | 跨任务自适应的Multi-Agent协作新范式

大型语言模型驱动的多智能体系统成解决复杂任务重要范式,但智能体协作存在关键问题。Griffith和西北农林科技大学团队提出OFA - MAS,将多智能体拓扑设计从one - for - one推向one - for - all,实验效果佳。

PaperAgent
7

没等VC下场,机器人厂商们先投了一家数据公司

2026年具身智能市场火热,智域基石获灵初智能等四家企业数千万元天使轮融资。其定位第三方数据公司,核心团队背景互补,明确不做本体、模型等四件事,还构建自动化编译管线处理数据。

AI科技评论