人 - 物交互」共找到 1626 篇相关文章

产品应用8

马斯克AI女友直播「一秒变身」,Karpathy看完立刻投钱

世界首个支持直播推流的「实时」扩散AI视频模型MirageLSD诞生,大神Karpathy亲自站台。它能理解真实视频后同步生成AI视频,实现零延迟、无限时长、每秒24帧不卡顿,给视频娱乐和直播互动带来丰富想象。

新智元
新闻资讯7

科学家Ilya不想当CEO,都是扎克伯格逼的

Ilya创办的SSI联创Daniel被Meta挖走,Ilya被迫出任CEO。因Ilya拒收购,而Daniel态度积极,两分歧产生。Ilya坚守目标,SSI靠名撑出320亿美元估值。

量子位
新闻资讯8

Gemini负责爆料!多模态统一token表示,视觉至关重要

Gemini模型行为产品负责Ani Baddepudi与谷歌AI Studio产品负责探讨Gemini多模态技术,涉及设计理念、应用及发展方向。指出多模态对构建AGI重要,还介绍Gemini 2.5视频理解亮点与‘万物皆视觉’理念。

量子位
新闻资讯7

一份假简历领5份硅谷AI工资,印度老哥真是不得了

一群AI初创公司控诉被印度老哥Soham Parekh骗了,他隐瞒真实情况远程兼职最多打五份工。此事引发老板吐槽,网友造梗,还引出r/overemployed社区OE现象,让思考OE对错。

量子位
开源动态8

揭秘 GitHub 11.1k 让你的存储秒变“万能盘”?JuiceFS:最好用的存储系统能为你带来怎样革命性的提升?

云存储成本高、性能差等问题让烦恼,JuiceFS 可零代码改造,将对象存储升级为高速共享文件系统。它功能丰富、架构有优势,代码示例简单,适用于多场景,相比竞品优势明显。

小华同学ai
开源动态7

开源端到端语音大模型:直接从原始音频输入,生成语音输出

目前大模型大多只能输出文本,机音频交互不顺畅。Step - Audio团队开源端到端语音大模型Step - Audio - AQAA,能直接听懂音频问题并合成语音回答,介绍了其架构和各核心模块。

AIGC开放社区
算法论文8

首个全面梳理语音大模型发展脉络的权威综述,入选ACL 2025主会

香港中文大学团队语音语言模型综述论文《Recent Advances in Speech Language Models: A Survey》被 ACL 2025 主会议接收,这是该领域首个全面系统综述,指明语音 AI 未来方向,还剖析技术架构、训练策略等。

机器之心
推荐文章8

巨头博弈下,Agent 的机会和价值究竟在哪里?

极客公园创始与拾象相关员对话,探讨 Agent 热点话题。指出其真正门槛或在基础设施,还谈及产品路径、技术挑战等,如通用 Agent 是大模型公司主战场,Coding 是衡量 AGI 关键指标等。

海外独角兽
算法论文8

一个md文件收获超400 star,这份综述分四大范式全面解析了3D场景生成

南洋理工大学研究者发表《3D Scene Generation: A Survey》综述,系统归纳300+篇论文,将3D场景生成方法分四大范式解析,还总结应用,探讨挑战与未来方向,如保真度提升、引入物理约束等。

机器之心
新闻资讯7

Genspark 将上线 AI 浏览器丨创始最新分享:我看到了 AGI

Genspark 下周将上线 AI 浏览器。其创始景鲲发文称,AI 将影响 99% 的工作,白领工作或消失,应届毕业生可能毕业即失业。他基于使用近 1000 种 AI 产品的经验,认为 AGI 即将到来。

特工宇宙