多模态Deep Research」共找到 1086 篇相关文章

产品应用8

3.4K星Apple出品FastVLM:视觉TTFT效率提升85倍,凭啥这么牛!

文章指出VLM在实际生产应用中因高分辨率图像存在效率问题,介绍Apple出品的FastVLM解决方案,阐述其架构、训练过程,展示在多个基准测试的性能,凸显在高分辨率输入下提升效率的优势及实际应用价值。

CourseAI
开源动态7

Hermes Agent 终于有入门指南了

Hermes Agent 是 Nous Research 推出的开源 Agent 框架,功能强大但开发者不知如何使用。4 月 8 号,Kevin Simback 整理出 Hermes 生态全景图,另一人推出《Hermes Agent: The Complete Guide》,48 小时获 568 星。

AI工程化
开源动态8

狂揽4万星!换掉OpenClaw太爽了,5美元就能养个AI打工人

Hermes Agent是NousResearch推出的开源Agent神器,上线后在GitHub超4万星。它运行在用户服务器,有六大核心特性,能跨平台对话。技能自维护,形成记忆 - 技能 - 训练数据闭环,应用场景丰富,演进注重安全、稳定与智能。

新智元
新闻资讯8

刚刚,全球视频模型新王诞生了!

天工AI的SkyReels-V4直接登顶Artificial Analysis文转视频全球榜,超越Veo 3.1、Sora 2。其相比之前有两大核心升级,让视频生成从‘生成片段’走向完整视频生产,还应用于短剧平台DramaWave。

量子位
算法论文8

CVPR 2026 | 还在为AI「鬼画符」发愁?TextPecker即插即用破解文字渲染难题

在生成式AI浪潮中,视觉文本渲染仍是未攻克的核心难题。华中科技大学白翔教授团队等提出TextPecker,是基于结构感知的即插即用型强化学习优化策略,可适配主流生成器,提升视觉文本渲染性能,已被CVPR 2026接收。

机器之心
新闻资讯8

谷歌AI连发6篇数学论文!Gemini攻入博士级科研,91.9%刷爆SOTA

谷歌DeepMind放出多篇重磅论文,Gemini Deep Think成「科研合伙人」,攻克多领域难题。谷歌打造基于Gemini的「AI数学家」Aletheia,在博士级难题获科研里程碑,首批6篇论文成果斐然。

新智元
开源动态8

字节开源GUI Agent登顶GitHub热榜,豆包手机核心技术突破26k Star

字节开源的豆包手机核心支撑GUI Agent模型UI - TARS登顶GitHub热榜,突破26k Star。它是多模态AI智能体,纯视觉驱动,部署简单,历经多轮迭代,成为热门开源多模态Agent。

量子位
新闻资讯7

在参与OpenAI、Google、Amazon的50个AI项目后,他们总结出了大多数AI产品失败的原因

Aishwarya Naresh Reganti 和 Kiriti Badam 参与超50个企业级AI产品构建。他们指出,如今AI产品构建成本降低,但多数仍失败。还分享开发陷阱与路径,如从低自治高控制起步、建立CC/CD框架等,也对AI未来发表看法。

InfoQ
算法论文8

LLM时代的事件抽取:从静态任务到认知脚手架

此综述论文探讨LLM时代事件抽取价值,认为其未被削弱,应视为“认知脚手架”。它系统梳理任务分类、方法演进等,还提出六大未来研究方向,指向将其演化为智能感知与记忆层。

深度学习自然语言处理
产品应用7

装了 AI 大脑的 Grep

本文介绍了 mgrep 工具,它有自然语言搜索、支持多语言多模态等特点。还说明了使用方法,如安装、登录、索引项目和搜索等,能与编码 Agent 配合,可补充 grep 进行代码搜索。

GitHubStore