模型验证」共找到 8060 篇相关文章

开源动态8

当 Agent 尝试接管浏览器,连“我是人类”都证明不了?上海交大开源发布交互评测基准 HLL

随着多模态大模型发展,Web Agent 面临验证码挑战。上海交通大学等团队发布 HLL 评测基准,解耦真实度为三维度,对 8 款前沿模型测试,揭示 Agent 在多步交互微操上的短板。

深度学习自然语言处理
产品应用7

央企怎么做超级智能体?对谈中电信天翼AI:自研模型为底座,自主规划是必须,能适应千行百业才行

中国电信天翼AI发布星辰超级智能体,获2025企业级AI Agent榜单央企第一。它依托自研“星辰大模型”,具备全模态、复杂推理等能力。访谈专家指出智能体可直接产出应用,落地需嵌入主业系统,电信持续迭代模型优化它。

量子位
开源动态8

ICCV25 Highlight|格灵深瞳RICE模型狂刷榜单,让AI「看懂」图片的每个细节

格灵深瞳公司灵感团队自研的视觉模型基座RICE(MVT v1.5)刷榜多项视觉任务,在ICCV25获Highlight荣誉。它延续MVT系列理念,提升图片内部视觉特征差异性,在多任务验证中表现优异。

机器之心
算法论文8

一个问题几百美元,DeepMind智能体一次搞定了9个Erdős问题

DeepMind团队的大模型在一次‘测试’中解决9个开放的Erdős问题,还自动验证,解法通过人工审查。其框架AlphaProof Nexus结合大模型与Lean编译器,研究展示了AI辅助正式证明搜索技术潜力。

机器之心
新闻资讯7

Claude 4如何思考?资深研究员回应:RLHF范式已过,RLVR已在编程/数学得到验证

Anthropic两位研究员在博客采访中透露Claude 4思考细节。提到可验证奖励强化学习RLVR在编程和数学领域获证明,探讨了RL扩展、模型自我意识等,还为大学生给出AI领域建议。

量子位
算法论文8

TPAMI 2026 | 北大彭宇新团队提出CPL++框架,实现视觉定位模型的「自知之明」和「自我纠错」

北大彭宇新教授团队提出CPL及进阶版CPL++框架。CPL用单模态匹配构造伪标签,引入静态验证模块;CPL++进一步自监督升级,具备纠错能力。实验显示,CPL++缩小了弱、全监督方法性能差距。

机器之心
算法论文7

AI生成的图片正在反向对齐人类的审美?ICML 2026观点论文Spotlight

UBC和Weathon Software研究指出,图像美学对齐削弱艺术表达。开发者用评估模型让图像生成模型产出符合人类审美的图片,但这导致图片同质化,限制艺术多元性,作者还提出六个相关担忧,并做多项测试验证

机器之心
新闻资讯8

从“卷模型”到“算总账”:AI 产业竞争开始拼什么 | 请回答 WAIC 2026

WAIC 2026热度高涨,InfoQ直播间追问‘AI正在重写什么’。与会嘉宾讨论AI产业新阶段变化,如从‘看能力’到‘算总账’,认为模型重要性方式已变,还探讨了AI原生产品定义、AI Infra影响及未来关注方向。

InfoQ
算法论文8

V-RAE:把「看懂视频」的能力带入生成,重新思考视频模型的潜空间

近日,新加坡国立大学 Minghui Guo 与牛津大学 Shengqiong Wu、Hao Fei 在论文中提出视频表征自编码器 V-RAE。它以冻结的视觉基础模型为编码器压缩视频特征,还引入轻量级模块聚合信息。经实验验证,其在视频生成和预测上性能出色。

机器之心
算法论文8

ICML 2026 | 大模型内部也会长出「情绪树」,规模越大越懂人心

ICML2026 论文指出,大语言模型内部会自然形成类似人类心理学模型的「情绪树」,模型越大,情绪树越复杂,且在销售等任务上表现更好。同时,模型的情绪结构受身份设定影响,存在与人类相似的情绪识别偏见。

机器之心