多模态评估」共找到 1558 篇相关文章

算法论文8

VLM剪枝新SOTA:无需重训练,注意力去偏置超越6大主流方案

常用的attention机制存在位置偏置和padding异常,影响剪枝效果。上海大学曾丹团队提出无需重新训练的attention去偏方法,在多模型、剪枝策略及基准上验证有效,为多模态模型部署提供新思路。

新智元
产品应用7

Pulsar特性在AI场景中的使用

随着AI发展,架构从单体到分布式演进,消息中间件成关键。Pulsar以存算分离等特性价值凸显,在多模态训练、模型训练、智能体等AI场景有独特优势,如处理超大消息、实现断点续训等。

InfoQ
开源动态8

具身智能迎来ImageNet时刻:RoboChallenge开放首个大规模真机基准测试集

近日,RoboChallenge推出全球首个大规模、多任务真机基准测试。它构建开放、公正、可复现的‘真实考场’,为视觉 - 语言 - 动作模型提供评估标准,推动具身智能发展,还提供远程测试服务等。

机器之心
新闻资讯8

直击CVPR现场:中国玩家展商面前人从众,腾讯40+篇接收论文亮眼

CVPR 2025落下帷幕,中国企业参与规模创纪录,腾讯40+篇接收论文亮眼。多模态、3D生成是热门方向,高斯泼溅技术成亮点。企业探讨主题拓展至产业应用,腾讯投入大,借顶会展示实力、吸引人才。

量子位
算法论文8

迈向无缝共生:大模型GUI Agent的「屏幕图灵测试」与拟人化之路

多模态大模型使GUI Agent能模拟用户执行任务,但也引发与平台的利益冲突。论文提出“屏幕图灵测试”和AHB基准评估拟人化能力,探讨拟人化策略及权衡,为Agent在数字世界共生提供指南。

AI科技评论
算法论文8

硅基大脑记忆觉醒!会遗忘、会反思、会成长的AI正在到来

哈尔滨工业大学等机构团队发表研究,用认知神经科学视角审视AI记忆系统,探讨如何让AI产生“自我”,构建会遗忘、反思、成长的记忆大脑,还涉及记忆分类、存储、管理、评估、防御及未来演进等内容。

AIGC开放社区
算法论文8

NeurIPS 2025 Spotlight | 条件表征学习:一步对齐表征与准则

文章指出传统表征学习处理图片和商品信息时存在局限,针对性有监督训练成本高,多模态大模型使用成本也需考虑。为此提出即插即用的条件表征学习方法 CRL,实验显示其在下游任务表现优异。

机器之心
开源动态8

Codex给V4-Flash装上眼睛,DeepSeek也会文档OCR

GitHub上的项目codex-vision-proxy让接进Codex的DeepSeek能看图,不用换模型或等官方,装本地代理即可。它还附带视觉工具包,在智能文档解析和OCR上潜力大,证明多模态能力可长在管道上。

CourseAI
新闻资讯8

前小米 OS 高管创业:你的下一部「手机」未必是手机

前小米OS高管董红光创立光帆科技,他认为AI将重塑消费电子行业,未来交互是“需求式”和“多模态”的,手机或不再是最适配设备,穿戴设备或先变革,未来多设备联动由AI大脑调度。

Founder Park
推荐文章7

Shopify分享了他们做Agent的万字踩坑经验

Shopify分享构建生产级AI助手Sidekick的万字经验。构建中遇工具拓展难题,用JIT指令解决;评估是大挑战,建立严谨体系,虽有提升但效果仍有波动,模型还会钻空子,最后强调单Agent系统也强大。

探索AGI