多模态框架」共找到 2423 篇相关文章

开源动态8

让模型“看视频写网页”,GPT-5仅得36.35分!上海AI Lab联合发布首个video2code基准

上海人工智能实验室等机构提出IWR - Bench评测基准,从“image - to - code”迈向“video - to - code”,对28个主流模型测试,最佳模型GPT - 5仅36.35分,指出当前模型短板,为研究指明方向。

量子位
开源动态8

NeurIPS 25 | 中大&UC Merced等开源RAPID Hand,重新定义多指灵巧手数据采集

来自多机构研究者联合提出全新开源高自由度灵巧手平台 RAPID Hand。它能解决硬件瓶颈问题,实现稳定、高质量数据采集。其软硬协同优化,在操作表现与稳定性上优于现有方法,还具备低成本等优势。

机器之心
算法论文8

跨越技术与法律的壁垒:AI赋能知识产权领域任务全能评测基准IPBench发布

本推文介绍arXiv论文《IPBench: Benchmarking the Knowledge of Large Language Models in Intellectual Property》。论文提出IPBench评估基准,构建含20个任务、10374个双语数据点的基准,评估17个主流模型,揭示现有模型在IP任务中局限。

深度学习自然语言处理
推荐文章7

从私域知识到智能 Agent:构建智能运维知识库

抖音算法工程师王宁在 QCon 大会分享,介绍将私域知识与 LLM 融合构建运维系统的方法,详解 SOPAgent 架构解决传统 AIOps 难题,还提及多模态数据处理、知识管理体系等亮点。

InfoQ
算法论文8

从捍卫者到引路人,上交&上海AI Lab提出LEGION:不仅是AI图像伪造克星,还能反哺生成模型进化?

AIGC技术发展使AI图像滥用问题严重,公众面临信任危机。上交与上海AI Lab等团队在论文中从构建数据集、设计模型、实现检测与生成统一三方面破局,LEGION能检测伪造,还可反哺生成模型进化。

机器之心
产品应用8

干翻全场!OpenAI深夜发布通用Agent。

OpenAI 发布 ChatGPT Agent,将 Operator 和 Deep Research 能力融合,能在虚拟电脑完成复杂任务。它功能强大亮点多,但也存在价格昂贵、安全隐患等问题,或压缩创业公司空间。

探索AGI
新闻资讯8

编码器-解码器架构的复兴?谷歌一口气发布32个T5Gemma模型

谷歌在xAI吸引眼球时更新Gemma系列模型,发布多模态模型MedGemma,还一口气推出32个T5Gemma模型。该模型基于适应技术,性能表现佳,引发编码器 - 解码器架构复兴讨论。

机器之心
算法论文8

AI"学霸"也解不出高中题?耶鲁、复旦发布MMSciBench,揭示AI理科推理能力短板

耶鲁、复旦等推出MMSciBench评测基准,揭示主流模型复杂科学推理短板。它有高质量数据、多模态多题型测试和精细知识分类体系。测试发现模型图文融合及推理能力弱,英文推理或效果更好。

深度学习自然语言处理
算法论文8

Google新研究:降低大模型幻觉的全新视角——充分上下文!

谷歌新研究《SUFFICIENT CONTEXT: A NEW LENS ON RETRIEVAL AUGMENTED GENERATION SYSTEMS》提出“充分上下文”概念,剖析RAG系统失败原因并给出解决方案,对提升企业AI准确性和可靠性有重要意义。

AI工程化
开源动态7

字节开源了一个了不得的模型!

字节跳动开源统一多模态基础模型BAGEL,一个模型能同时理解和生成文本、图像、视频。部署测试有亮点但效果不稳定,还分享该模型体验Demo、地址及安装使用教程。

探索AGI