「长视频理解」共找到 2145 篇相关文章
大模型能“原地”改参数了!字节Seed&北大新论文:测试时推理无需加层重训练
字节Seed和北大研究团队提出In - Place TTT方案,让大模型能“原地改参数”。它复用Transformer的MLP模块,解决现有TTT架构不兼容、计算效率低和优化目标不匹配问题,实验证明可提升模型长文本任务表现。
The Batch: 931 | 统一视觉媒体的单一分词器
Apple团队开发多维分词器AToken,可将图像、视频、3D对象映射到共享token空间,统一处理视觉媒体。它由预训练编码器和解码器组成,经多阶段训练,在多任务上达或接近先进水平,为视觉模型带来通用性。
AI在「赚钱锦标赛」夺冠,比人类还会做生意!躺赚时代要来了?
研究人员提出自动售货机运营模拟环境Vending - Bench,测试大模型智能体管理业务能力。实验显示不同大模型性能方差大,Claude 3.5 Sonnet净资产表现最佳,人类基线在可靠性上表现较好,各模型长周期表现波动大。
14.9g颠覆行业,AI眼镜终于实现无感日常佩戴|甲子光年
在AI硬件浪潮中,AI眼镜被视为有潜力替代手机的形态。心眸科技发布的AI眼镜Moonix,重14.9克,回归眼镜本质,以“记录”为核心,具备主动式AI能力,能实现“记录 - 理解 - 分享”闭环。
CoT 之后,CoF 如何让帧间逻辑从「隐式对齐」变成「显式思考」?
CoT 虽提升语言模型推理能力,但在 C 端场景有局限,且被质疑并非真实推理。视觉领域提出 CoF 概念,Google DeepMind 团队引入理论,让视频模型通过帧链推理提升帧间一致性,还具强大泛化能力。
OpenAI 全面拥抱 Agentic-First,实测有点扎心
OpenAI发布GPT - 5.6系列,Sol定位长周期Agent,训练目标转向Agentic - First。但目前难以用上Sol,且其评测数据因计数规则差异大,还出现变身话痨、少说话和干完活难兼顾的问题。
OpenAI 内部揭秘:我们如何使用 Codex
文章揭秘 OpenAI 内部使用 Codex 的情况,介绍其在理解代码、重构迁移、性能优化等多方面的应用场景,还给出最佳实践,如用‘提问模式’开始、组织好提示等,展现了 Codex 强大的开发辅助能力。
最强AI PPT Skill!小白3分钟做大片感演示稿
本文介绍了鲸格PPT Skills,它是语义驱动的静态演示系统。区别于多数AI PPT工具,它先理解内容语义再呈现,支持多格式输出,有独特架构、动效和审美规则,生成的PPT可编辑、交互性强。
AI 行业最新的 18 个前沿认知
文章整理了火山引擎AI领航者计划活动中,大厂、投资人和创业者对AI行业的18条前沿认知,涵盖模型层、应用层和产业层,如强化学习成竞争焦点、视频生成将崛起等,展现2026年行业新趋势。
200亿国产巨头,在这个赛道做到了全球第一
声学传感器龙头歌尔微电子冲刺港交所,它是全球第五大、中国第一大智能传感交互解决方案提供商,全球第一大声学传感器提供商,市场份额达43%。其发展历程长,技术投入大,虽面临挑战,但上市后未来可期。