「长视频理解」共找到 2156 篇相关文章
分割一切并不够,还要3D重建一切,SAM 3D来了
深夜 Meta 重大更新,上线 SAM 3D、SAM 3。SAM 3D 含物体与场景重建、人体形状与姿态估计两模型,能将 2D 图转 3D 重建结果。SAM 3 可检测、分割与跟踪图像视频物体。Meta 开放模型权重与代码,推体验平台。
GPT-5超越人类医生!推理能力比专家高出24%,理解力强29%
最新研究显示,GPT - 5在医疗领域处理多模态信息能力出色,在多模态测试中推理和理解得分比GPT - 4o分别提高近30%和36%,比人类医生还高。其能力提升源于端到端多模态架构,但现实应用还需更多实战考验。
一个上海AI独角兽爆发了
全球AI圈因MiniMax“发布周”沸腾。新模型MiniMax - M1被视为“性价比新王”,还有新视频、语音模型表现出色。其89年博士闫俊杰带队,在大模型研发上多次做非共识选择,现估值超30亿美元,还推出智能体产品。
大模型外挂“三维物体知识库”来了,大幅增强机器人长程自主操作能力
现有视觉语言大模型(VLM)能让机器人理解指令,但在操作中缺三维空间知识。近日研究提出 RAM 框架,它像“三维物体知识库”,为 VLM 补充空间知识,经 14 项实验验证其操作能力,还探索了在铰接与柔性物体操作中的应用。
投入AI越多,跌得越猛!美股巨头只有AI拉胯的苹果在猛涨
本周财报季,亚马逊、谷歌和微软等科技巨头虽营收光鲜,但股价集体跳水,市值合计蒸发9000亿美元。因2026年计划砸6600亿美元建AI基建,市场担心回报周期长。而苹果未参与军备竞赛,与谷歌合作,营收创新高、支出降低、股价上涨。
大模型思维链推理速度倍增!——RoT新框架把思维链「画」进隐空间
随着大模型规模扩展,思维链(CoT)成处理复杂推理任务标准范式,但显式CoT依赖长序列生成,隐式CoT面临优化挑战。腾讯提出RoT新框架,利用视觉编码器将文本推理步骤转为视觉嵌入,实现Token压缩与推理加速,且过程可分析。
明晚直播|从《黑客帝国》到迪士尼乐园:谈《拟像与拟真》
法国后现代思想大师让·波德里亚在《拟像与拟真》中预警数字时代图景。2025年12月5日19:30—21:30,豆瓣读书联合南大社·守望者邀汪民安等嘉宾,结合电影探讨波德里亚思想及拟像,直播在豆瓣读书视频号同步。
AI大模型开发核心技术栈:从框架到部署的全景解析
本文为开发者提供2025年AI大模型开发核心技术栈图谱,解析四大核心支柱技术。基础开发框架含深度学习与AI Agent框架;模型训练与微调有分布式训练、参数高效微调;推理优化含关键技术与主流框架;AI编程辅助工具分主流形态且有发展趋势。
AI x 保险图谱:第一家 AI-Native 的保险独角兽会长什么样?
保险业规模庞大但运营效率极低,超 60%流程依赖人工,索赔周期长、客户满意度低。过去两年,LLMs 提升了 AI 处理非结构化信息的能力,使 AI 接管保险核心流程成为可能。GenAI startup 围绕保险流程构建产品,AI-native 保险公司也应运而生。
大的来了:谷歌Gemini 3.0 Pro单次生成网页版操作系统,Win、Mac、Linux一网打尽
海外平台爆火的视频展示了用未发布的谷歌Gemini 3.0,仅靠几行提示词在2分钟内One Shot生成网页版操作系统。与Claude 4.5 Sonnet对比,Gemini 3.0优势明显,还展现出高超前端设计能力,但离真正构建操作系统仍有距离。