「单目语义场景补全」共找到 2392 篇相关文章
Artificial Analysis 榜单第二,SkyReels-V4 宣告 AI 视频进入「全栈统一」阶段
昆仑天工的 SkyReels-V4 在 Artificial Analysis 文生视频榜单排第二,ELO 评分 1090。它有「运动参考」能力,能覆盖视频创作全工作流,背后靠统一拼接框架和双流 MMDiT 架构,体现 AI 行业「统一」趋势。
医疗领域DeepSeek时刻:蚂蚁 · 安诊儿医疗大模型正式开源,登顶权威榜单
2026 年初,OpenAI 报告显示不少人用 ChatGPT 咨询医疗问题,还发布了 ChatGPT 健康。近日,蚂蚁集团等开源的蚂蚁・安诊儿医疗大模型或成最优解,它参数量大,在多评测中登顶,技术优势明显。
VGGT4D:无需训练,挖掘3D基础模型潜力,实现4D动态场景重建
香港科技大学(广州)与地平线研究团队提出 VGGT4D,无需训练,通过挖掘 Visual Geometry Transformer 注意力层运动线索,在动态物体分割等任务表现优异,为 4D 重建提供新思路。
太卷了!专属Coding的新一代Arena榜单来了,有国产模型登上榜首
大模型编程竞争激烈,编码能力提升成军备竞赛。LMArena发布新世代大模型编码评估系统Code Arena,国产模型智谱GLM - 4.6登上榜首,其编码能力获认可,彰显国产大模型硬核实力。
真实场景也能批量造「险」!VLM+扩散模型打造真实域自动驾驶极限测试
浙江大学与哈工大(深圳)联合推出SafeMVDrive,将VLM关键车辆选择器与两阶段轨迹生成结合,可在真实域批量制造高保真安全关键视频,用于端到端自动驾驶系统安全性测试。
靠AI破解癌症,初创公司融下3000万刀!新目标:建10亿单细胞数据集
福布斯介绍,初创公司Tahoe Therapeutics融资3000万美元构建活细胞AI模型,估值达1.2亿美元。该公司已研发出针对一种主要癌症亚型的候选药物,还开源数据集,与其他公司合作开发AI agent。
单GPU搞定高清长视频生成,效率×10!引入Mamba机制突破DiT瓶颈 | 普林斯顿&Meta
普林斯顿大学和Meta联合推出新框架LinGen,以MATE线性复杂度块取代传统自注意力,使单张GPU能在分钟级生成高质量视频。它在视频质量上优于DiT,减少FLOPs和延迟,与先进模型相当。
AI子弹已上膛!OpenAI斩获美国防部2亿美元大单,密谋向微软「开枪」
AI巨头权力洗牌加速,OpenAI与微软因收购Windsurf及股份问题关系紧张,甚至考虑反垄断指控。同时,OpenAI获美国防部2亿美元合同,有「OpenAI for Government」计划,还致力于建设算力设施。
开启 AI 自主进化时代,普林斯顿Alita颠覆传统通用智能体,GAIA榜单引来终章
普林斯顿大学AI Lab推出通用智能体Alita,秉持「极简即是极致复杂」哲学,采用「最小化预定义」与「最大化自我进化」设计范式,可自主创造MCP工具,在GAIA基准测试中表现卓越,还能实现MCP复用。
只用图像也能思考,强化学习造就推理模型新范式!复杂场景规划能力Max
现有 MLLM 依赖文本处理视觉信息,会造成信息丢失。剑桥、伦敦大学学院、谷歌团队提出视觉规划范式,以强化学习框架 VPRL 提升模型规划能力,实验显示其性能优于文本规划。