多模态融合」共找到 1364 篇相关文章

算法论文8

Seedream 4.0大战Nano Banana、GPT-4o?EdiVal-Agent 终结图像编辑评测

在AIGC下一阶段,图像编辑成检验多模态模型关键场景。研究者提出EdiVal - Agent评估框架,能自动化生成指令并多维度评估编辑结果,其评估与人类判断一致性高,还对比了13个模型的多轮编辑表现。

机器之心
新闻资讯8

提效软件研发,AI Agent好用吗?

InfoQ直播邀请多位专家探讨AI4SE,提及前端知识库特点、Agent自学习等。专家认为AI目前多辅助人类,落地要重视“人”因素,还探讨了应用挑战、衡量维度、未来趋势等,QCon上海站将设专题。

InfoQ
推荐文章8

从Transformer到Agent:生成式AI行业技术路线与职业发展指南,深度解析AI价值链

文章深度解析生成式AI行业,介绍其宏观图景、商业运作、行业定位与战略考量。指出行业价值链呈“杠铃”形态,应用层机会大,还提及盈利模式、岗位薪酬、开源闭源之争等,为从业者提供职业指南。

AI Reading Hub
算法论文8

读万卷书,大模型就能「看」懂视觉世界?Meta揭秘LLM视觉先验的起源

Meta超级智能实验室与牛津团队新论文发现,只见过文本的大语言模型(LLM)能学到可迁移到视觉任务的先验能力。研究通过超100组受控实验、耗费50万GPU小时,揭开LLM视觉先验来源,还给出预训练数据配方。

机器之心
开源动态8

沉寂一个月,openPangu性能飙升8%!华为1B开源模型来了

华为发布专为昇腾端侧硬件打造的openPangu Embedded - 1B模型,仅10亿参数却性能卓越。它运用多阶段训练和优化,在权威基准表现亮眼,V1.1平均分较上月跃升超8%,还介绍了背后技术。

机器之心
算法论文8

EMNLP2025 | LLM多次回答一致就一定正确吗?非也

随着LLMs在高风险领域广泛应用,其输出的事实性错误引发安全质疑。中科院计算所和美团团队论文揭示自我一致错误,传统检测方法对此失效,提出跨模型探针法提升检测能力。

深度学习自然语言处理
推荐文章7

2025年最戳心的纪录片:程序员的变与不变,太真实了

文章围绕《十字路口》纪录片,讲述开发者在 AI 时代的变与不变。AI 使开发权下沉,传统开发者角色被重新定义。纪录片记录开发者蜕变,展现其在行业变革中的选择,揭示技术革命中“人的价值重构”。

InfoQ
产品应用8

WAIC现场最“聪明”展台!AI眼睛耳朵能力全打开了

WAIC现场,声网展台被观众挤爆,其新奇“AI玩具”都能与玩家流畅对话。声网对话式AI引擎全新升级,新增选择性注意力锁定、视觉理解能力,能与主流数字人方案集成,还可接入大模型,价格低。它已在多领域落地。

量子位
8

Transformer终结者!谷歌DeepMind全新MoR架构问世,新一代魔王来了

KAIST、谷歌DeepMind等机构发布的MoR架构,推理速度翻倍、内存减半,重塑LLM性能边界,碾压传统Transformer。它融合参数共享与按需计算,有路由和KV缓存策略,实验显示其性能优越、可扩展性好。

新智元
产品应用7

看到这个小红书卖虚拟产品获利百万的案例,我才发现AI翻译的信息差真大

作者建议AI开发者先了解大众需求再做产品。分享小红书上AI翻译变现案例,还展示智谱BigModel开放平台翻译智能体的多模态翻译案例,介绍其解决AI翻译问题的亮点及适用场景。

花叔