人 - 物交互」共找到 1626 篇相关文章

推荐文章8

11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI

过去两年,AI 生成图片、视频变得容易,但让 AI 理解并按创作者意图创作很难。美图影像研究院过去几年围绕高频创作场景痛点展开研究,11 篇论文被国际顶会接收,成果通过产品落地转化为 AI 影像能力。

机器之心
开源动态7

看傻了!5k Star Canvas Editor,我被惊到啦~~~~

Canvas Editor是基于HTML `<canvas>` API的文档编辑器,自己控制绘制、分页、交互和导出。文章介绍其与普通编辑器差异、核心能力、适用场景、接入代码,也指出项目限制,认为它是架构新选择。

小华同学ai
产品应用7

谷歌把电脑操作能力塞进Gemini 3.5 Flash!自己看屏幕狂点70轮

谷歌将电脑操作能力Computer Use内置进Gemini 3.5 Flash,该AI能通过看屏幕操作电脑,可执行点击、打字等动作。其覆盖网页、桌面软件和移动端,还加入安全约束机制,在基准测试中表现良好。

量子位
推荐文章8

从预测到干预,Aether AI为什么押注因果世界模型?

Aether AI 定义技术路线为「因果世界模型」,关注模型识别影响结果的变量、理解因果结构、模拟干预后果。它从预测未来的局限切入,介绍了因果能力的三类核心问题及研究成果,还用四层架构实现能力落地。创始黄碧薇看好当下时机,从 Physical AI 切入创业。

机器之心
产品应用7

Current Robotics 发布 Curr-0:以 Single Policy 实现全身灵巧操作

Current Robotics发布Curr - 0,解决形机器移动与操作分离困境。它用Single Policy统一训练,基于HumanEx采集数据,还构建多物理模态交互世界模型,是全栈具身智能基础设施成果。

AI科技评论
算法论文8

ACL 2026|证据摊开看,场景图画清:让流式视频大模型拿捏「何时开口」

随着多模态和大语言模型发展,类与 AI 交互走向共生。现有视频大模型难把握响应时机,西北工业大学等团队在 ACL 2026 提出 Response - G1 框架,实验显示其提升了模型性能。

机器之心
产品应用7

抢疯了!AI宠物翻译器:800多块,预售2万单

PettiChat宠物翻译器售价800多,预售2万单。它能将猫狗叫声转成句子,翻译延迟1.2秒,还具备位置追踪、安全警报和声音克隆功能。其靠大模型的声音识别和情绪推理系统实现翻译。

量子位
新闻资讯8

智谱创始唐杰透露:原生多模态模型将在数月内上线

智谱创始唐杰透露原生多模态模型数月内上线。智谱上市后股价涨幅大,但多模态是短板。唐杰还判断今年AI最可能在长时程任务突破,阐述技术支柱、自我进化等观点,称将重塑各行业。

AI前线
产品应用8

设计行业天塌了!Anthropic再推王炸产品Claude Design:设计稿、原型、PPT一句话搞定

Anthropic推出平台级产品Claude Design,用Claude Opus 4.7模型助力设计。它能让各类用户完成视觉内容创作,有多种使用场景和便捷工作流程,还给出内部设计师使用建议。

AI寒武纪
新闻资讯7

疯了……Claude 最强风控:验你实名身份证!

Anthropic更新支持文档,宣布在Claude平台引入身份验证机制,目的是防滥用、执行政策和履行义务。验证需有效证件、带摄像头设备,由Persona Identities处理数据。此前OpenAI也有类似机制,这或加剧AI使用群分化。

AGI Hunt