「第一视角视频问答」共找到 1415 篇相关文章
豆包 Seed 2.0 Lite升级:给 Agent 装上眼睛和耳朵
近期模型发布竞争激烈,作者做视频字幕常遇识别错误,因语音识别工具缺上下文。字节方舟的豆包 Seed 2.0 Lite 升级后能听,还可结合上下文准确输出字幕,成本降 20%,也能理解视频,为工作流补全感知。
字节Seed提出M3-Agent:像我们一样"记住"与"思考"的长视频理解新范式
字节Seed提出M3 - Agent,这是首个融合实时视听输入、类人记忆构建与自主推理的多模态智能体。它模仿人类记忆机制,解决长视频理解痛点,已被CVPR 2025收录并开源代码,为通用人工智能奠定基础。
41个榜单SOTA!智谱最新开源GLM-4.5V实测:看图猜地址、视频秒变代码
智谱基于GLM - 4.5打造的开源多模态视觉推理模型GLM - 4.5V,在42个公开榜单中41项夺得SOTA。其功能丰富,玩法升级,还为企业与开发者提供高性价比方案,是100B参数级SOTA标杆。
新Vidu Q3参考生,这是冲着「剧」来的!万物皆可参考:特效音效场景都备好了
生数科技Vidu Q3发布参考生视频,为剧而生,万物可参。它能凭几张图和Prompt生成影视级特效、音效和场景。实测显示其特效、音效、场景表现出色,还解决AI视频创作痛点,兼顾专业与普惠。
CVPR 2026 | 从视觉Token内在变化量出发,实现VLM无损加速1.87倍
随着高分辨率图像与长视频处理需求增长,大型视觉语言模型推理效率成瓶颈。V²Drop从视觉Token内在变化量出发,采用多阶段渐进式剪枝策略,实现无损加速,在图像和视频理解场景表现卓越。
5款大模型考「山东卷」,Gemini、豆包分别获文理第一名
近日,字节跳动Seed团队用2025年山东高考真题对5款大模型进行全科闭卷测评。结果显示,豆包Seed1.6 - Thinking获文科第一,Gemini 2.5 Pro获理科第一。大模型一年间进步显著,未来或融入更多领域。
Google 发布首个全模态 Embedding 2 模型,文本图片音视频 PDF 统一到一个向量空间
Google发布Gemini Embedding 2模型,它是业界首个原生支持文本、图片、视频、音频和PDF五种模态的Embedding模型,可将这些数据映射到同一向量空间,在多模态RAG、跨模态搜索等场景有应用,还介绍了跑分、用法、竞品、价格等情况。
季度AI视频生成产品:多模态输入成标配,角逐一站式生成能力 | 量子位智库AI 100
Sora2下载量破百万引发AI视频生成热潮,谷歌推出Veo3.1再掀高潮。国外大厂将其卷至电影制作级创意,国内企业追求高质量、秒级生成并落地垂直场景。量子位智库发布的产品呈现多维度技术演进。
全球唯二、国内首个,阿里万相2.6杀疯!Sora 2瞬间不香了
阿里万相2.6系列模型上线,成为业界功能最丰富的视频模型,是全球唯二、国内首个具备角色扮演功能的模型。其音画一体,能生成15s长视频,指令遵循能力强。还可将提示词转换为多分镜脚本,团队公开了提示词公式。
刚刚,AI视频的天花板被掀翻!测完SkyReels后飘了:我亦有成为专业导演的潜质
昆仑万维官宣上线全新一站式多模态AI视频创作平台SkyReels,同步发布模型SkyReels V3并优化多能力。实测其画布、Agent等功能玩法多,还打通多模态边界,将巩固昆仑万维地位,加速人人专业创作愿景到来。