「视频 - 音频联合生成」共找到 2045 篇相关文章
Transformer论文作者之一Noam Shazeer宣布离开Google,加入OpenAI
6月18日,Google DeepMind工程副总裁、Gemini模型联合负责人Noam Shazeer宣布离开Google加入OpenAI。他是Transformer架构提出者之一,技术实力强。Google曾花27亿美元请他回归,仍没留住。
DeepSeek刚解决了AI视觉最后一块拼图:极低成本+精准视觉定位,AI接管电脑已无死角
DeepSeek放出新论文《Thinking with Visual Primitives》,解决多模态大模型中长期被忽视的“说不清位置”问题。提出将空间标记作为“最小思维单元”插入推理链条的方案,在多个任务上达前沿水平,但也存在精度、触发机制和泛化能力等局限。
字节最火的开源Agent项目,如何思考Agent的自我进化?
4月5日,LangChain创始人Harrison Chase阐述对Agent自我进化的思考,认为Agent系统可在Model、Harness、Context三层持续进化。知名开源框架DeerFlow联合作者Daniel也补充了团队思考。
极客部落“OPC 创业者招募计划”正式发布,赋能 AI 时代“一人独角兽”
3月20日,极客部落“OPC创业者招募计划”开放日活动举行,聚焦AI时代OPC创业范式。活动揭牌“极客部落·AI应用生态园”,宣讲扶持政策,发布合作基金,探讨OpenClaw对创业生态影响,助力创业者成长。
基于 AI 的机器人攻陷微软、DataDog 和 CNCF 项目中的 GitHub Actions 工作流
近期,一个基于AI的机器人利用GitHub Actions工作流,在2026年2月21 - 28日对微软、DataDog等项目发起攻击,成功在多个代码库实现远程代码执行并窃取凭证,还出现AI对AI攻击,组织需加强安全审计。
80万条数据揭示隐患:AI正在「污染」病历,你的诊疗数据可能越来越不靠谱
新加坡国立大学等机构团队研究显示,AI生成临床文本用于训练新模型,会使病理信息在数据迭代中消失,降低医疗AI诊断可靠性。研究分析80多万条合成数据,还提出缓解方法。
英伟达机器人掌门人Jim Fan年度复盘:Vibe Coding火出圈,机器人领域却依然焦头烂额
AK推文让Vibe Coding火出圈,而英伟达机器人负责人Jim Fan对2025机器人领域发展泼冷水,指出硬件可靠性差、Benchmark混乱、VLA路线存问题等现状,并分享3个教训,还回应网友质疑。
中心动态重分配哈希,北邮团队提出并开源CRH项目 | AAAI 2026
北京邮电大学等机构联合提出新颖端到端框架 CRH,在训练哈希函数时动态更新哈希中心,提升检索精度和语义一致性。论文被 AAAI 2026 收录,代码已开源。
初赛鸣金,精英集结 | 云谷杯·2025 人工智能应用创新创业大赛初赛顺利举行
11月7日,云谷杯·2025人工智能应用创新创业大赛初赛线上举行,100余项目角逐,30个进复赛。大赛多方主办,赛制等全面升级,有丰厚奖励和政策支持,承办方InfoQ助力项目成长,复赛将选10强。
ICCV25 Highlight|格灵深瞳RICE模型狂刷榜单,让AI「看懂」图片的每个细节
格灵深瞳公司灵感团队自研的视觉模型基座RICE(MVT v1.5)刷榜多项视觉任务,在ICCV25获Highlight荣誉。它延续MVT系列理念,提升图片内部视觉特征差异性,在多任务验证中表现优异。