「视频大模型」共找到 9566 篇相关文章
突发!快手AI掌舵人周国睿即将离职,下一站爆出
多个媒体爆料,快手副总裁、基础大模型及推荐模型负责人周国睿即将离职,目前本人在快手内部系统显示为休假状态。其去向不明,有传加入Meta或TikTok,官方未回应。
ICML spotlight | 一种会「进化」的合成数据!无需上传隐私,也能生成高质量垂域数据
大模型发展使数据短缺问题加剧,特殊领域更严重。为此提出合成数据自主进化框架PCEvolve,只需少量标注样本,就能在保护隐私同时进化出数据集,还介绍了其架构、选择器设计及实验结果。
千万级标注成本归零!CVPR 2025清华团队成果:相机的“自运动”就是最好的老师
以往空间音频模型受限于采集条件和标注成本,清华和密西根大学团队在CVPR 2025给出新路径,利用相机自运动作监督信号,让模型从互联网视频学三维空间音频感知,成果入选会议Highlight。
企业数字化转型新引擎:MCP + LLM + Agent 架构赋能!
本文介绍MCP(Model Context Protocol)模型上下文协议,它是Anthropic于2024年11月底推出的开放标准,可统一大模型与外部数据源和工具通信协议,打破数据孤岛,有诸多优势,还适用于多个场景。
效果逼真到让人窒息!开源Ctrl-Crash模拟车辆事故
近年来视频扩散技术在生成车辆碰撞真实场景时面临挑战,因驾驶数据集中事故样本稀缺。Mila团队提出Ctrl - Crash可控碰撞视频生成模型,支持反事实场景生成,但也存在一些局限。
AI仅凭“自信”学会推理,浙大校友复刻DeepSeek长思维链涌现,强化学习无需外部奖励信号
UC Berkeley团队提出新训练方法Intuitor,大模型无需接触真实答案,仅优化自身信心就能学会复杂推理。该方法无需外部奖励信号或标注数据,用模型自身置信程度作内在奖励信号,在多任务表现良好。
2026「中国 AGI 创新影响力机构 TOP 30」发布
过去一年 AI 行业变化溢出模型层,Coding Agent 铺开,视频生成实现商业变现,具身智能供应链成型。Founder Park 从四维度选出「中国 AGI 创新影响力机构 TOP 30」,涵盖多领域团队。
2篇最新152页论文,RL+LLM被彻底讲透了!
今天分享2篇2025最新RL×LLM的技术综述,分别聚焦“RL在LLM全生命周期的打法”和“RL如何炼成大推理模型”,梳理玩法、组件、算法演进等内容,还给出开源模型、数据等盘点。
不是,高考刚结束,高考报志愿的Agent也来了?
夸克官宣夸克高考志愿大模型,虽未多提Agent,但作者认为其比Agent还Agent。该模型免费,以Qwen为基座,结合高考知识库,能生成详细志愿报告,考虑多方面需求,助力学子报志愿。
图像编辑新神器:英伟达用拍电影思维解决图像编辑与世界模拟一致性难题
AI图像编辑物理一致性难题待解,现有方法易产生违反物理定律的漂移编辑。英伟达和多伦多大学提出ChronoEdit框架,将图像编辑视为拍微型电影,借助视频生成模型的时间连续性知识解决问题,在实验中表现卓越。