人体 - 物体交互」共找到 676 篇相关文章

开源动态8

DeepSeek V4没做的,MiniCPM-o 4.5给做「全」了~

上周 DeepSeek V4 发布,遗憾不是多模态。今天 MiniCPM-o 4.5 补上短板,凭 9B 参数实现端到端全双工全模态大模型,自 2026 年 2 月发布后 Hugging Face 下载量超 25 万。还推出多项成果,性能表现出色。

PaperAgent
算法论文8

你敢把「龙虾」放在手机上跑吗?手机 Agent 离落地还差一道「隐私关」

港中深联合腾讯混元研究揭示,手机 Agent 落地关键不在成功率,而在隐私边界。研究设计隐私交互协议,构建模拟 App 记录过程,将常见越界行为归类检查,评估多个模型发现诸多隐私问题。

AI科技评论
产品应用7

苹果推出 Ferret-UI Lite:一款用于查看和控制 UI 的端侧 AI 模型

苹果推出 30 亿参数的 Ferret-UI Lite 端侧 AI 模型,可解析屏幕图像、与应用交互。现有 GUI 智能体方法存在建模复杂等问题,Ferret-UI Lite 性能有竞争力,训练采用两阶段流程,还给出应用建议。

InfoQ
算法论文8

大模型桌游试玩员来了:用五大画像模拟「千人千面」,评分精准度超越GPT-5.1

盛大东京研究院等团队提出MeepleLM,首个能模拟玩家视角给出建设性批评的虚拟试玩模型。它构建专属数据集,引入MDA理论,提炼五种玩家画像。实验显示其评分精准度超GPT - 5.1等通用模型。

量子位
开源动态8

前端开的同学,天塌啦,AI把前端开发最后一公里给补上啦,不敢相信,太夸张啦~~~

Vercel Labs 开源的 agent - browser,是面向 AI Agent 的无头浏览器自动化 CLI。它解决了 AI 前端开发缺真实浏览器验证交互的问题,适用于多场景,有诸多对 AI 友好的特性,还介绍了使用方式。

小华同学ai
产品应用7

没错,马斯克的二次元「女友」被雷蛇装到外设里了

CES 2026 展上,雷蛇推出 Project Ava,以 5.5 英寸 3D 全息动画呈现二次元少女等形象。它基于 AI 驱动,能感知情境、交互友好。不过其由 Grok 驱动,有“调情”风格,还存在隐私侵入争议。

机器之心
算法论文8

挖掘注意力中的运动线索:无需训练,解锁4D场景重建能力

香港科技大学(广州)与地平线团队提出VGGT4D,通过分析VGGT内部机制,利用注意力层运动线索,提出无需训练框架,在动态物体分割等任务表现优异,为低成本4D重建提供新思路。

量子位
开源动态8

最低 306KB,这款低延迟语音检测神器太绝了!

语音交互中,VAD至关重要。新开源的TEN VAD能精准识别语音起止,是替代WebRTC VAD和Silero VAD的优选。它低延迟、高准确率、极致轻量,已被Kaldi集成,还能跨平台部署,使用方便。

开源先锋
产品应用8

完爆ChatGPT!谷歌这招太狠:连你的「阴阳怪气」都能神还原

谷歌发布Gemini 2.5 Flash原生音频模型,可保留语调进行实时语音翻译,实现拟人化交互。还具持续监听、风格迁移等功能,提升开发者所需的函数调用、指令遵循等能力,另有实验产品Disco。

新智元
产品应用7

豆包官宣手机助手:AI 还能带来哪些新体验?

字节豆包团队官宣做手机助手,它基于操作系统层面授权,背靠豆包大模型带来交互创新。虽无自研手机计划,但正与多家厂商洽谈合作。开放体验机型是与中兴合作的nubia M153。

AI科技评论