「视觉智能」共找到 3924 篇相关文章
告别「面瘫」配音,InfiniteTalk开启从口型同步到全身表达新范式
传统video dubbing技术有局限,新兴模型也有问题。美团视觉智能部研发的InfiniteTalk引入‘稀疏帧video dubbing’,实现口型、表情、肢体与音频自然对齐,解决长视频生成难题,技术已开源。
对话灵感实验室:全帧率 VLM、低成本与分层部署,业务现场不止需要炫技模型
InfoQ对话格灵深瞳灵感实验室,探讨多模态大模型下视频理解问题。指出传统视频模型抽帧处理浪费算力和信息,介绍LLaVA - OneVision - 2.0突破长视频理解瓶颈,还提及“视觉智能工坊”助力业务落地。
哈萨比斯:DeepMind才是Scaling Law发现者,现在也没看到瓶颈
哈萨比斯在Axios AI+峰会上称Scaling Law最早由DeepMind发现,靠它可能达成AGI,还预测未来12个月AI发展,如多模态融合、视觉智能突破等,且Gemini目标是成通用助手。
WAIC最强亮点:非Transformer离线AI大模型已大规模量产,大模型商业比我们想得更快
在WAIC上,RockAI推出非Transformer离线AI大模型Yan 2.0 Preview,有视觉感知跃升和自主学习能力两大提升。该公司走非Transformer路线,着重场景落地,通过“标杆战略”推动产品量产,未来构想构建“群体智能”世界。
李飞飞自曝详细创业经历:五年前因眼睛受伤,坚定要做世界模型
在a16z播客节目中,“AI教母”李飞飞讲述创业经历。五年前眼伤失立体视觉,让她意识到其对空间交互的决定性作用。她认为真正通用智能需理解物理世界,与Martin Casado一拍即合创立World Labs,加速世界模型突破。
阿里Qwen3一大波更新:代码生成、视频、图片、语音全都有
阿里Qwen3迎来一大波更新,涵盖多个模型。如Qwen3-Max在代码与智能体表现卓越;Qwen3-VL是强大视觉语言模型;Qwen3-Omni是全模态模型;还有图像编辑、同传、安全防护等模型及旅行规划师等应用。
杀疯了!单卡4090跑通全量微调,面壁1B级多模态性能怪兽硬刚大厂
面壁智能推出MiniCPM-V 4.6,参数约1B,性能和推理效率出色。它在多模态任务综合能力、推理速度上领先竞品,靠ViT架构改造和4倍/16倍混合视觉Token压缩实现创新,有工业验证,对开发者和普通用户意义大。
对话 IDEA 张磊:「不以动作为输入条件,就不叫世界模型」
本文是对IDEA研究院张磊的深度访谈。张磊在计算机视觉领域成就斐然,他指出具身智能落地需攻克成功率、泛化性等挑战,大脑比本体更关键。还阐述了世界模型概念及应用,定义其应具备动作依赖等内容。
Karpathy:LLM渴望的不是生存,而是你的点赞
Andrej Karpathy指出人们对‘智能’理解肤浅,动物智能与LLM智能源于不同优化压力。动物智能源于自然选择,而LLM智能来自统计模拟、强化学习微调等,两者在多层面有差异,LLM受商业进化影响大。
科学智能2.0的「最强大脑」!上智院复旦无限光年联合发布开放平台
WAIC 2025上,上海科学智能研究院、复旦大学、无限光年联合发布「星河启智科学智能开放平台」。它以六大核心能力打造科学智能生态、驱动科研范式变革,致力于实现「科学的AI次方」效应。