视觉交互」共找到 1210 篇相关文章

产品应用8

阿里发布首个「音视频实时交互」模型,实现数字人实时视频聊天

阿里发布原生流媒体端到端模型Wan - Streamer v0.1,能实时聆听、观看、思考、说话和响应视频。它在单个Transformer内完成感知等操作,延迟低,具备端到端多模态统一、低延迟等特点。

开源AI项目落地
新闻资讯7

Meta出走华人创业团队,种子轮800万美元,要打造视觉AI记忆大脑

由前Meta顶尖科学家创立的Memories.ai获800万美元种子轮融资。其大视觉记忆模型LVMM解决AI‘记忆缺失’问题,在多领域刷新SOTA基准,应用潜力大,还开放API及网页应用。

机器之心
开源动态8

文本已死,视觉当立!Karpathy狂赞DeepSeek新模型,终结分词器时代

DeepSeek新成果DeepSeek - OCR以像素处理文本,压缩率小于1/10,基准测试领跑,开源一夜获4.4k星。Karpathy力挺,认为应赶走分词器,展望视觉成通用输入前景,马斯克有更科幻猜想。

新智元
产品应用7

更新啦!我用 Claude Skills 做的剪辑 Agent!识别效果+交互大升级

作者成峰根据用户反馈对剪辑 Skills 做了大改,替换火山引擎音视频识别模型、提升交互界面。改进包括用 API 替代本地模型、重构口误识别系统、设可视化审核界面,还介绍了简单使用方法。

AI产品自由
开源动态8

NLWeb: 让每个网站都装上一个智能的“对话引擎”

微软近日开源NLWeb项目,致力于简化网站构建对话式交互界面的过程。它利用现有网络生态,定义协议让用户或AI代理与网站交互,具有降低门槛、开放社区驱动等优势,目标是构建“AI Web”。

AI工程化
开源动态8

DeepSeek-OCR是「长文本理解」未来方向吗?中科院新基准给出答案

DeepSeek-OCR的视觉文本压缩技术降低长文本处理成本,中科院自动化所等团队推出VTCBench基准测试评估模型视觉认知,含三大任务及衍生版本,测试结果有‘U型曲线’,还评测多种尖端模型。

新智元
开源动态8

Hugging Face开源nanoVLM,750行代码可训练视觉语言模型,简单到令人发指!

Hugging Face开源全新视觉语言模型框架nanoVLM,仅750行代码就能从零训练高效能VLM模型。它在单张H100 GPU训练6小时后,在MMStar数据集准确率达35.3%,且能在免费Google Colab跑。

AGI Hunt
算法论文8

镜头被油污糊住,机器人还稳定操作?北大/清华等给VLA加一道信息筛选,不靠额外数据,效率提升14x,真机鲁棒性反而更高了 | ICML 2026

北大、清华等机构联合提出StableVLA,相关工作被ICML 2026接收。该工作提出轻量级IB - Adapter,不依赖额外数据对视觉特征筛选对齐,让机器人遇视觉干扰仍能稳定执行任务,实验展现出鲁棒性提升。

量子位
产品应用7

腾讯无极低代码平台打开MCP之外的新思路:多模态聊天

腾讯无极低代码平台提出‘前端多模态智能’概念,让AI输出内容更多样,可嵌入交互页面片。它还给出四步配置法实现‘多模态聊天’,与MCP形成互补,能增强信息交互和用户掌控感。

腾讯技术工程
产品应用8

3.4K星Apple出品FastVLM:视觉TTFT效率提升85倍,凭啥这么牛!

文章指出VLM在实际生产应用中因高分辨率图像存在效率问题,介绍Apple出品的FastVLM解决方案,阐述其架构、训练过程,展示在多个基准测试的性能,凸显在高分辨率输入下提升效率的优势及实际应用价值。

CourseAI