视觉泛化」共找到 985 篇相关文章

开源动态8

对抗协作+原型学习!深北莫FedPall开源,联邦学习破局特征漂移,准确率登顶SOTA

深圳北理莫斯科大学人工智能研究院在ICCV发表FedPall算法,结合原型对比与对抗协作学习,在多种特征偏移数据集获SOTA性能。该算法通过多步骤训练缓解特征漂移,在多个公开数据集表现出色。

机器之心
产品应用8

字节发了个机器人全能大模型,带队人李航

字节推出Seed,其Robix视觉—语言单模型能搞定机器人推理、任务规划和自然语言交互,核心采用思维链推理和三阶段训练策略,效果超Qwen2.5 - VL、GPT - 4o等,负责人是李航。

量子位
新闻资讯8

刚刚,李飞飞主讲的斯坦福经典CV课「2025 CS231n」免费可看了

斯坦福大学经典CV课程《CS231n:深度学习与计算机视觉》(2025春季)正式上线,学生能学习实现和训练神经网络。课程由李飞飞等四人主讲,全部18个视频可在Youtube免费看。

机器之心
算法论文8

突破Pass@1瓶颈:一种让LLM自我博弈、永不枯竭的RL新范式,超越基线22.8%!

近年来,基于可验证奖励的强化学习(RLVR)在提升大型语言模型(LLM)推理能力上有关键作用,但存在熵崩溃问题。论文提出SVS创新策略,让模型自我合成变分问题形成自我提升循环,实验效果惊人。

深度学习自然语言处理
开源动态7

MIDAS:快手可灵发布实时交互式数字人生成框架

近年来交互式数字人视频生成受关注,但实时处理多模态输入有挑战。快手可灵团队提出MIDAS框架,基于LLM驱动的自回归模型,结合轻量级扩散头,实现低延迟、交互式多模态控制,还构建大规模数据集等。

带你学AI
算法论文8

真实场景也能批量造「险」!VLM+扩散模型打造真实域自动驾驶极限测试

浙江大学与哈工大(深圳)联合推出SafeMVDrive,将VLM关键车辆选择器与两阶段轨迹生成结合,可在真实域批量制造高保真安全关键视频,用于端到端自动驾驶系统安全性测试。

新智元
开源动态8

DeepMind 没舍得开源的 Genie 3,被昆仑万维放出来了

过去一周世界模型赛道热度高涨,DeepMind发布的Genie 3未开源,昆仑万维却在8月12日推出自研升级版Matrix - Game 2.0并完整开源。它定位产业化,能让世界模型从实验室走向生产线,还带来盈利模式转变。

AI科技评论
新闻资讯7

AI 陪伴硬件的反共识讨论:主体性很重要,同质化竞争不存在

文章围绕AI陪伴硬件展开讨论,邀请创业者探讨产品角色定位、性别设定、用户反馈等问题。指出产品应注重主体性,避免破坏角色感,还提及应对同质化竞争、产品寿命、视觉研究等方面的思路。

Founder Park
产品应用8

AI世界名画复活走秀爆了,全网疯转!梵高达利莫奈同框谢幕,网友哭崩

国外ODDY工作室借助AI让世界名画及角色复活,打造超写实视频《名作艺术秀》。视频中梵高、达利等大师及作品化身“T台模特”,还有“幕后故事”,带来视觉盛宴,引发网友热议。

新智元
算法论文8

一文读懂深度表格数据表示学习 | 南京大学

南京大学团队系统介绍表格表示学习领域,将现有方法按泛化能力分三类,比较DNN与树模型优劣,剖析核心挑战,探讨扩展方向及数据集评估策略,旨在建跨数据集稳健评估体系。

量子位