多模态检索」共找到 1147 篇相关文章

产品应用8

字节豆包2.0重磅发布!成本暴降一个数量级,Seed团队揭秘视频Agent竞争关键

今日字节发布豆包大模型2.0系列,围绕大规模生产环境需求优化,有Pro、Lite、Mini和Code四款模型。其Token单价低一个数量级,多模态理解能力升级,未来将围绕长链路智能系统构建发展。

InfoQ
算法论文8

ICLR 2026 oral | AI代码真能进生产环境?SwingArena:从「写对代码Commit」到「通过CI审查」

过去一年大模型写代码能力提升,人们思考其能否参与软件工程核心流程。现有评测基准有缺失,SwingArena填补空白,将博弈引入评测,设计检索增强流水线,其开源后或成评估AI编程能力新工具。

机器之心
开源动态8

斩获20K星!再见PDF排版噩梦,这个开源神器让文档处理爽到飞起!

MinerU是上海人工智能实验室推出的开源数据提取工具,能将多模态文档解析为Markdown,支持精准提取图片、表格、公式,具有多语言支持、高性能等特点,应用场景广泛,还开源免费。

小华同学ai
推荐文章7

面向 AI Agents 的高性能数据基座:架构和工程实践

在 QCon 全球软件开发大会上,晨章数据创始人陈亮分享了面向 AI Agents 的高性能数据基座。他指出 AI Agent 驱动的应用带来数据挑战,提出多模态数据基座设计目标,并介绍工程实践,证明传统架构有 CPU 瓶颈。

InfoQ
8

我用MiniMax Agent开发了个带后端的全栈网站,全程0代码

2025年Agent成AI领域焦点,大厂纷纷布局。作者测试MiniMax Agent,发现其有四大特点:深度研究和上下文管理强,多模态输出出色,编程能力超预期,能执行定时任务,还能开发带后端的全栈网站。

花叔
新闻资讯7

视频版Nano Banana来了!内置Gemini世界知识;原版香蕉出图仅需4秒

谷歌开放Gemini Omni Flash API,将多模态推理与视频生成编辑结合,有4项关键能力,也有局限。Nano Banana 2 Lite出图快且便宜。二者串联使用,图像生成与视频创作可无缝衔接。

量子位
产品应用7

Legora、Mercor 都在用,Reducto 能成为独立的 LLM 数据入口吗?

当前企业AI落地瓶颈在数据质量,Reducto聚焦数据准确性,以文档解析API提供Agentic OCR能力。它获多轮融资,估值达6亿美元,但面临多模态模型竞争及定价等问题,其未来走向待察。

海外独角兽
开源动态8

通义实验室新研究:大模型自己「扮演」搜索引擎,提升推理能力无需搜索API

阿里通义实验室开源ZeroSearch,提供无需与真实搜索引擎交互的强化学习框架。它用模拟搜索环境和渐进式抗噪训练,让LLM自给自足,节省API成本,在多问答数据集表现优,为智能化检索提供新思路。

量子位
新闻资讯7

GLM-5.3你来定!智谱唐杰全球征集意见,评论区清一色:视觉

清华教授、智谱唐杰在𝕏征集GLM下个版本意见,浏览量达40w+。此前他有求必应,网友热情参与。这次评论区多要视觉能力,因GLM-5.2是纯文本模型,而对手多为多模态

量子位
产品应用7

千问办公初体验:“三合一”更好用吗?

作者体验阿里千问办公内测版,它是三合一AI产品Qwenwork。虽系统设计距Codex有差距,但整合优势对普通用户有意义,具备CLI化、生态打通、多模态、拓展生态等特点,不过还需打磨。

鲸选AI