多模态数字人」共找到 2206 篇相关文章

新闻资讯8

AI Coding大佬聊透了:产品智能重要还是用户体验重要?答案让意外

量子位举办AI Coding沙龙,百度、硅心科技等多位行业玩家参与。探讨AI编程从替代转向协作、智能体发展、To B与To C界限模糊等话题,指出未来产品智能更重要,编程产品将服务更广群,程序员技能需转变。

量子位
开源动态8

AI 真能看懂物理世界吗?FysicsWorld:填补全模态交互与物理感知评测的空白

多模态大语言模型正经历范式转变,目标是实现全模态协同交互。但现有评测体系难跟上模型发展。飞捷科思和复旦团队推出 FysicsWorld 基准,可评测模型多能力,还提出 CMCS 策略,为全模态智能发展提供指引。

机器之心
产品应用7

通用模型无法完全理解用户,AI产品的下一站是上下文的战场|对话AI知识助手remio

量子位智库对话remio创始汪源,探讨其开发初衷、核心价值等。remio主打无感自动化,成用户第二大脑,有信息捕获、管理等功能,数据本地存保隐私。还聊了目标用户、指标、功能及应对竞争等。

量子位
算法论文7

ICCV2025 | 多视图生成新范式-利用自回归模型探索多视图生成

本文介绍自回归生成多视图图像方法 MVAR,能从先前视图提取引导信息增强一致性,拉近与基于扩散方法的图像质量差距。解决了多模态条件控制和数据有限问题,展示出强指令遵从与多视角一致性。

机器之心
算法论文8

生成式视角重塑监督学习!标签不只是答案,更是学习指南 | ICML 2025

上海交大等机构团队在ICML 2025提出预测一致性学习(PCL),通过扩散过程消减标签信息,引入噪声标签,将标签学习分解为渐进式任务,实现标签信息复用。在多模态任务实验中,PCL表现优于传统监督学习。

量子位
新闻资讯8

深度讨论 Gemini 3 :Google 王者回归,LLM 新一轮排位赛猜想|Best Ideas

近期,OpenAI、Google、Anthropic 先后发布新模型,引发大模型竞赛。本文聚焦 Google 发布的 Gemini 3,从算力、数据、架构等维度剖析其强大原因,探讨大模型竞争新格局,还涉及多模态、硬件、商业化及产品形态等方面。

海外独角兽
产品应用8

网友疯玩Gemini 3!AI造物门槛真是0了

才发布一天,Gemini 3 Pro就被网友玩出花。热门玩法数字拍立得,复古照片直出;还能打造AI版“4399小游戏”网,及“一张图造应用”玩法,如将图片转化为游戏、网站等。

量子位
推荐文章8

卧底硅谷AI独角兽60天:没有KPI,自觉996,不接受远程办公

本文揭秘了AI编程独角兽Cursor早期工作氛围。它招不走寻常路,无KPI但员工自发996。产品聚焦提升专业开发者能力,奉行Dogfooding文化。靠使命驱动,两年成业界黑马,重产品轻利益。

量子位
产品应用8

3D生成到达3.0阶段,不止提升行业渗透率,也正催生3D原生新玩法 | 对话3D生成平台Tripo

AI 3D生成领域前景广阔但也有疑惑焦虑。量子位智库对话VAST创企,其创始与CTO分享3D原生玩法、落地场景,还谈产品开发、需求发掘等认知,Tripo平台已覆盖众多用户。

量子位
新闻资讯7

对话寻影:大家都在解决怎么拍得更好,我们想干掉「拍」这件事

这是对睿魔智能(OBSBOT 寻影)创始刘博的采访。2016 年浙大四团队创业,让摄像机自动拍摄。公司连续五年 50%以上增长,全球高端 Webcam 市占率第一。刘博分享发展历程、产品逻辑、市场策略等。

Founder Park