「多模态交互」共找到 1457 篇相关文章
字节跳动&清华大学开源多模态时序大模型ChatTS,可实现时序数据对话与推理
字节跳动与清华合作开源多模态时序大模型ChatTS,可实现时序数据对话与推理。它用合成数据训练,解决了数据稀缺等问题,在评估中表现远超基线模型,未来可拓展至更高阶任务。
3.4K星Apple出品FastVLM:视觉TTFT效率提升85倍,凭啥这么牛!
文章指出VLM在实际生产应用中因高分辨率图像存在效率问题,介绍Apple出品的FastVLM解决方案,阐述其架构、训练过程,展示在多个基准测试的性能,凸显在高分辨率输入下提升效率的优势及实际应用价值。
Lex Fridman 对话 DHH:Omarchy,才是真正属于 Agent 时代的操作系统
Omarchy 有望成今年最火 Linux 桌面系统、首个 Agent 时代操作系统。开发者 DHH 曾怀疑 Agent 编程,现 Quattro 代码全由 Agent 编写。DHH 做客播客,谈 Omarchy、AI 时代操作系统变化等。
终于找到一个开源神器!用画布喂给 Claude Code,上下文再也不用打字说了!
开发者用文字向 AI 说明需求繁琐,思路易跑偏。BonsAI 是 macOS 原生应用,提供无限画布,可让 Agent 实时读取改写。它亮点多,还有连接器功能,能成编程工具‘前置处理器’。
大神李沐回归B站「做了个实时数字人」,直言「水平吊打我自己」
大神李沐回归B站,展示用创业公司BosonAI的Higgs Avatar v1模型做的实时数字人,称其水平“吊打自己”。该模型能带来接近真人的临场感,操作简单,有四大核心优势,已进入内测。
AI 终于能"玩手机"了:Mobile MCP 让大模型直接操控你的 iOS 和 Android
Mobile MCP 是开源 MCP Server,让支持 MCP 协议的 AI 客户端操控 iOS 和 Android 设备,通过自然语言指令完成操作,解锁自动化测试等场景,但成功率有待提升,目前更适合探索性测试等。
新鲜出炉!Claude Code之父亲授 Opus 4.7 最佳实践
Anthropic发布的Opus 4.7被定位为最强模型,Claude Code创始人Boris Cherny分享使用最佳实践,介绍4.7与4.6区别、构建交互编程会话方法、effort等级设置等内容。
刚刚,全球视频模型新王诞生了!
天工AI的SkyReels-V4直接登顶Artificial Analysis文转视频全球榜,超越Veo 3.1、Sora 2。其相比之前有两大核心升级,让视频生成从‘生成片段’走向完整视频生产,还应用于短剧平台DramaWave。
CVPR 2026 | 还在为AI「鬼画符」发愁?TextPecker即插即用破解文字渲染难题
在生成式AI浪潮中,视觉文本渲染仍是未攻克的核心难题。华中科技大学白翔教授团队等提出TextPecker,是基于结构感知的即插即用型强化学习优化策略,可适配主流生成器,提升视觉文本渲染性能,已被CVPR 2026接收。
字节开源GUI Agent登顶GitHub热榜,豆包手机核心技术突破26k Star
字节开源的豆包手机核心支撑GUI Agent模型UI - TARS登顶GitHub热榜,突破26k Star。它是多模态AI智能体,纯视觉驱动,部署简单,历经多轮迭代,成为热门开源多模态Agent。