深度多模态整合」共找到 1866 篇相关文章

算法论文8

DeepSeek视觉原语论文:当所有人在堆图像分辨率时,它在堆「指代精度」!

4月30日DeepSeek发布多模态论文,核心是“视觉原语”,让模型边推理边输出坐标。它是七大coding agent玩家中最后接入视觉的,但补课方式反共识,不堆分辨率堆指代精度,效率高,拓扑推理成绩领先。

花叔
新闻资讯7

Nano Banana 2突然现身!能画公式解数学题,监控画面都能伪造

Nano Banana 2代以预览版现身第三方网站,后被移除。其能力远超1代,能处理复杂提示,可生成复杂UI、解数学题甚至伪造监控画面。谷歌正将Nano Banana整合进核心产品生态。

量子位
开源动态8

面向长时语音与声音克隆的全模态开源万能聊天机器人MGM-Omni

文章介绍了全模态开源聊天机器人MGM - Omni,它基于MiniGemini,支持多模态输入输出,具备长语音理解、生成、流式生成、零样本语音克隆等特性,还给出安装、使用方法,展示评估结果。

GitHubStore
产品应用7

使用 Hugging Face 轻松构建并共享 ROCm 内核

自定义内核是高性能深度学习基础,但构建整合麻烦。Hugging Face的kernel - builder和kernels库可助轻松构建、分享自定义内核。本文聚焦构建ROCm兼容内核,展示构建、测试与分享步骤。

Hugging Face
开源动态8

5.6K Star!原本付费现在开源!本地版“ElevenLabs”,视频翻译+声音克隆全免费!

今天给大家安利GitHub上开源神器Voice - Pro,它原本是商业付费软件,因团队无暇管理而开源。整合多个先进语音模型,将视频处理流程打包成本地软件,免费且功能强大。

开源星探
算法论文8

医疗AI智能体全面综述:行业爆发,年增长130%!

研究人员发布医疗健康AI智能体全面综述,梳理其全生命周期。数据显示截至2025年相关论文较2024年增超130%。研究前沿在数据、技术、应用上扩展,同时指出面临的挑战与未来方向。

新智元
推荐文章7

大小模型协同架构在金融智能投顾中的应用与挑战

本文整理自北银金科高级算法专家尹辰轩分享,介绍大小模型协同架构下的大模型投顾方案,能解决幻觉问题、优化回答深度。还提到 12 月 19 - 20 日 AICon 北京站聚焦多热门方向。

InfoQ
算法论文8

夜间感知新突破!北航等提出红外主导的高效目标检测方案 | ECCV'26

在复杂视觉场景中,传统RGB - IR多模态检测方法在低照度等场景下因RGB退化影响检测效果。北航等团队提出的InfraNet,以红外为主,用质量感知机制控制RGB引导,在多数据集取得强竞争力结果。

新智元
新闻资讯8

Karpathy:写了20年代码,现在像作弊

Karpathy曾造词“vibe coding”,一年后弃用。他开源autoresearch项目,让AI Agent自主跑实验,自己不写代码。他还展示家庭监控分析系统也由Agent完成。他提出“agentic engineering”,认为工具虽变,但深度技术专长更重要。

新智元
新闻资讯7

刚刚,OpenAI新Transformer火了!Astra架构首次曝光

OpenAI下一代Astra采用「循环深度」推理方法,思考Token减少但性能提升,不过其思考过程难监控。此前业界已对「循环Transformer」有研究,该架构适合数学编程任务,Astra实力获验证,GPT - 6或即将发布。

新智元