「全模态推理」共找到 3756 篇相关文章
用完这张无限可能的AI画布,第一次感觉人类导演要失业了!
2024年7月上线后迅速风靡海外的SkyReels发布最新版本,它重构AI创作生态,打通「图片—音频—视频」全栈,集成多种功能于一张画布,还推出专家智能体,让普通人轻松创作高质量内容。
State of AI 2025:霍桑效应下,AI 是「赚钱机器」还是「泡沫机器」?
Air Street Capital发布2025年度《State of AI Report》,证实AI成重要经济增长动力,但技术突进伴随矛盾。报告提及AI推理能力有‘霍桑效应’,或成泡沫,不过AI - first公司商业化加速,付费工具采用率和合同价值飙升。
三大核心创新公开,快手开源多模态Keye-VL 1.5拿下视频理解SOTA,8B力压GPT-4o!
快手开源多模态Keye-VL 1.5,为8B视频理解大模型,公开3大核心创新技术。靠Slow - Fast视频编码等,在20 + 基准屠榜。它能精确视频定位,实验显示通用、视频理解和数学推理表现佳。
PITT | 提出PhyT2V框架:让文生视频(T2V)更符合物理规律(CVPR2025)
当前T2V技术迈向推理驱动阶段,物理规律是关键约束。匹兹堡大学团队提出PhyT2V框架,不依赖模型重训练或大规模外部数据,可增强主流T2V模型能力,有低落地门槛和良好泛化性。
AI生成视频总不符合物理规律?匹兹堡大学团队新作PhyT2V:不重训练模型也能让物理真实度狂飙2.3倍!
匹兹堡大学团队提出 PhyT2V 框架,论文已被 CVPR 2025 接收。该框架不依赖重训练或大量外部数据,通过链式推理与迭代修正机制,增强主流 T2V 模型物理场景泛化与生成能力,应用前景广。
Action Map Policy:从高维动作回归到像素分类,一种新的机器人操作学习范式
本文介绍美国东北大学博士生黄浩杰提出的全新机器人操作学习范式Action Map Policy(AMP),将高维三维机器人动作转化为二维图像空间的像素分类问题,性能和推理速度均显著优于现有主流基线方法。
追觅CES亮剑:一台AI具身机器人的洗衣革命|甲子光年
2026年CES上,追觅推出首款AI具身洗护机器人,可完成洗衣全流程。它整合多系统,展示新创新逻辑。具身智能分阶段发展,追觅结合制造与技术,欲降低用户洗护成本,但落地仍面临挑战。
国产AI拿下国际物理奥赛金牌,13项顶级竞赛豪取12金1银,划重点:开源
上海人工智能实验室团队推出开源模型家族P1,在IPhO 2025理论考试中,P1-235B-A22B成首个达金牌线的开源模型。引入PhysicsMinions后成绩提升,在HiPhO基准排名第一,且全链路开源。
The Batch: 866|GPT-5 起飞遇乱流
OpenAI推出GPT - 5及其系列模型,涵盖多种类型,有新功能与性能提升。但发布中路由器故障等问题让用户失望。它在部分基准测试表现佳,不过抽象推理能力有不足,还回顾了发布历程。
180 天狠赚 5.7 亿,8 人团队全员财富自由,最大功臣是 Claude 和 Gemini
海外巨头 Wix 斥 8000 万美元收购成立仅 6 个月的 AI 公司 Base44。其创始人 Shlomo 用 AI 打造“开箱即用”开发平台,采用“全栈原生”理念突围。Shlomo 分享创业经历、工具使用及增长策略等。