「全模态推理」共找到 3787 篇相关文章
DeepSeek刚解决了AI视觉最后一块拼图:极低成本+精准视觉定位,AI接管电脑已无死角
DeepSeek放出新论文《Thinking with Visual Primitives》,解决多模态大模型中长期被忽视的“说不清位置”问题。提出将空间标记作为“最小思维单元”插入推理链条的方案,在多个任务上达前沿水平,但也存在精度、触发机制和泛化能力等局限。
AI 精神病的巅峰:Claude Mythos 和 OpenAI Spud 还没上线,就有人度假都睡不着了
还未发布的Claude Mythos和OpenAI Spud在舆论场引发热议,大众情绪被拉高。OpenAI推出GPT - 5.4 - Cyber,还跟进‘安全’故事。网友对‘模型太危险只能少数公司用’说法存疑,同时GPT - 6等新模型消息不断。
Meta 143亿挖角后首个作品来了:Alexandr Wang 推出闭源模型,杨立坤点赞
沉寂9个月后,Alexandr Wang带队的Meta发布新一代模型Muse Spark。它是原生多模态推理模型,性能媲美Gemini Pro和GPT 5.4,Meta还披露技术实现细节。不过闭源引争议,且模型在长时程智能体等方面有短板。
微信AI绝密计划曝光!但一个前腾讯员工,已经在硅谷做出来了
腾讯正为微信秘密开发AI智能体项目,计划2026年年中灰度测试,三季度全量上线。而前腾讯工程师已在硅谷做出全球首个人类与AI共生社交网络Teamily AI,能让Agent进群协作,有三层架构支撑。
还在玩AI 3D手办?Gemini 3 Deep Think已能直出STL,可打印实物
推理模型赛道竞争激烈,谷歌 Gemini 3 Deep Think 迎来重大升级,能处理科研级、工程级、多条件约束问题,可将用户要求等建模成 3D 打印实体文件,还能用于多领域科研和工程,欲成科研工程‘第二大脑’。
李飞飞又被超越了?百万「普通视频」打造通用4D世界模型!
全行业为昂贵多视角数据发愁时,中科院和CreateAI推出NeoVerse,用百万单目视频打开4D世界模型大门。它抛弃多视角数据和离线预处理,解决扩展性瓶颈,在重建速度、生成质量等方面表现出色,有丰富下游应用。
千问 APP 再更新:为什么说「聊天」并不是 AI 产品的终点?
当前AI市场进入场景战役阶段,头部玩家都在去聊天化。千问APP此次升级,可在同一界面内完成办公场景从需求到成品的全流程,还覆盖多种模板,引入智能编辑器,是务实且有意义的探索。
12月首炸!可灵 O1 正式发布,全球首个统一多模态视频大模型,强得可怕!
12月快手旗下可灵发布全球首个统一多模态视频大模型Kling O1,标志AI视频进入“全流程语义控制时代”。它将多种视频创作能力统一,有全能引擎等五大亮点,性能对比优势明显,让AI视频生成更可控。
通往通用人工智能的关键一步?DeepMind放大招,3D世界最强AI智能体SIMA 2
Google DeepMind发布SIMA 2,这是能在虚拟3D世界自主游戏、推理和学习的通用AI智能体。它集成Gemini模型,从指令跟随到主动认知跃进,泛化性能提升,还具备自我提升能力,为AI和机器人技术发展提供新路径。
靠创始人亲自假扮AI起家,如今估值10亿美元!印度CEO公开反内卷:从不在10点前起床,也不开例会
AI笔记创业公司Fireflies估值达10亿美元,其创始人曾人工假扮AI参会。CEO Krish Ramineni反内卷,让员工全远程自由工作。此“创业血泪史”公开后引争议,有人批有伦理风险,也有人认为是早期创业常态。