「语义动作流」共找到 612 篇相关文章
6秒造一个「视频博主」,Pika让一切图片开口说话
8月11日,Pika推出“音频驱动表演模型”,允许用户上传音频结合静态图片生成高度同步视频,角色口型、表情、动作自然,平均6秒出720p高清视频,目前仅限iOS端且需邀请码。
2025.7.4上午 | 视觉智能驱动的多模态对齐与推理的近期系列工作分享 - 复旦博士生王思尹
本次分享由复旦博士生王思尹围绕‘视觉智能驱动的多模态对齐与推理’展开,介绍多模态大模型探索研究,涉及跨模态组合语义理解、视觉参与推理及基于视觉建模世界完成行动等内容。
数据「熵增」时代,AI 如何以标准重构治理秩序?
Agent热潮下数据分析与治理有短板,Gartner预测到2027年多数数据治理举措或失效。瓴羊Dataphin高级技术专家周鑫阐述以数据标准为核心的数据治理方法论及AI赋能自动化治理实践路径。
人类创造力的核心机制,AI已经开始掌握了 | 北大CogSci 2025(Oral)
北大团队论文揭示AI开始掌握人类创造力核心机制,提出IEI框架量化评估AI组合创造力。研究发现GPT - 4等在创意理解超普通人,框架优化可提升AI创意输出质量,论文被CogSci 2025收录。
宇树机器人租不出去了
2025开年,宇树机器人因春晚表演成“顶流”,人形机器人租赁爆发。但热潮渐退,其租赁市场萎缩,复购率低。技术上实现简单动作难,商业化前景存疑,行业凸显理想与商业的矛盾。
世界模型炒作了半年,反应速度还不如 VLA?穆尧团队和百度智能云给出最新解法
生成式世界模型用于机器人控制备受争议,因其推理延迟高。上海交通大学 ScaleLab 团队等联合发布 AHA - WAM,解决推理延迟和时空分辨率错配问题,在任务成功率和推理速度上领先,还需系统协同推进落地。
卡帕西李飞飞辛顿都投了的Transformer专用芯片,签下10亿美元大单
Etched是只做Transformer专用芯片的创业公司,获卡帕西、李飞飞、辛顿投资。它宣布流片成功,筹集8亿美元,获10亿美元客户大单,还推出一整套面向前沿模型推理的集群系统。
网站GEO技术端优化指南:案例+工具+免费检查清单【转推】
文章指出当前处于传统搜索到AI搜索转型期,Google仍是主流。介绍Google和ChatGPT流程差异,给出抓取、索引、曝光优化建议,还列了该做与不该做之事,并有免费检查清单。
两个月前的预测成真:千问APP真的打通了阿里生态
近期AI圈动态频出,Google与沃尔玛合作搞AI购物,Anthropic发布Claude Cowork。而阿里千问App更快一步,1月15日成功接入淘宝、闪购等实现AI购物与办事。千问基于阿里生态打通内部,具备强模型与丰富生态优势。
从「会表演」到「更会演」:KlingAvatar2.0让数字人拥有生动灵魂
近日快手可灵团队发布 KlingAvatar2.0 技术报告,数字人能‘生动表达’。它有三大创新技术,如时空级联框架等。实验显示其生动性大幅提升,性能超竞品,推动数字人在多领域规模化应用。