「多模态交互」共找到 1457 篇相关文章
创新性自动化 AI 工具-终结者机器人
Terminator是最快的AI优先计算机操作SDK,用类似Playwright的API与Windows原生GUI应用交互,比基于视觉的方案更快更可靠,能操作后台应用。它重点支持Windows,部分支持macOS,暂不支持Linux。
无需租GPU,一台24GB内存的笔记本就够了!
阿里开源稀疏 MoE 模型 Qwen3.6-35B-A3B,总参数 35B,激活 3B。它在智能体编程上超越前代,可与稠密模型媲美,支持多模态,已在 Qwen Studio 上线,还能集成第三方编程助手。
SIGIR 2025 | 视频检索新范式!北邮、北大等联合提出AV-NAS:首个音视频哈希搜索架构,让Mamba与Transformer自动“组队”
北邮、北大等团队提出 AV-NAS,在多模态视频哈希领域引入 NAS,构建含 Transformer 与 Mamba 的统一搜索空间。该方法能自动发现最优跨模态融合机制,揭示音频时序建模中“CNN + FFN”结构更优,代码已开源。
三维空间太难懂?RoboTracer让机器人理解复杂空间指令,推理3D空间轨迹,开放世界也能精确行动
家庭环境复杂,让机器人理解空间指令难,现有VLM多聚焦2D推理。北航、北大等联合推出多模态大模型RoboTracer,能精准生成3D轨迹,在多项评测中领先,还能直接集成到机器人,完成复杂任务。
AI落地的另一种可能性
Sam Altman用APP解决AI落地问题,如将ChatGPT打造成“超级APP”,但此模式有交互形态受限、生态割裂的缺点。作者认为这是权宜之计,并设想把AI作为“通用智能层”嵌入各行业软件,Anthropic有此可能。
救命! Canvas?3.1k Star Mind Elixir ,真丝滑!!!!
Mind Elixir是可嵌入的JavaScript脑图内核,零依赖、框架无关。它能将JSON数据变成可交互节点,有拖拽、编辑等功能。适合知识库等场景,不适合只需不可编辑宣传图等场景。
突破全模态AI理解边界:引入上下文强化学习,赋能全模态模型“意图”推理新高度
在多模态大语言模型应用多元的当下,对模型理解人类意图需求迫切。阿里巴巴通义实验室团队推出HumanOmniV2,解决现有推理路径问题,其相关代码等开源,在多基准数据集成果突破性领先。
最低仅需2G显存,谷歌开源端侧模型刷新竞技场纪录,原生支持图像视频
今天凌晨,谷歌官宣Gemma 3n,原生支持多模态。它在大模型竞技场超1300分,是首个超此分数的10B以下模型。其VRAM占用低,最低2GB,已在谷歌AI Studio等可用,还公开了技术细节。
李飞飞3D世界模型公测,网友已经玩疯了
今日李飞飞创立的World Lab推出全新3D世界生成模型Marble并开启公测。普通人能靠文本等生成专属3D世界,还能在VR体验。它功能强大,未来将重点发力交互性。
ChatGTP 发布 Agent 了,但我更推荐 MiniMax
作者受邀内测 MiniMax Agent 新功能,体验用其搭建 AI 资讯聚合网站,无需写代码,两小时搞定。该产品全栈开发功能强大,有 MCP 生态,多模态能力出色,对比 ChatGPT Agent 更具优势。