「视频字幕处理」共找到 1877 篇相关文章
Gemini 3「开眼」像素级操控!谷歌回应DeepSeek-OCR2
Google DeepMind为Gemini 3 Flash推出Agentic Vision,让模型主动编代码操控图像,性能提升5% - 10%。该能力已上线,谷歌还计划扩展功能。这或许是受DeepSeek-OCR2刺激,两者技术路线不同。
真实音频场景,大模型集体挂科!首个原生语音基准MultiChallenge
Scale AI发布首个原生音频多轮对话基准Audio MultiChallenge,撕开大模型靠合成语音评测维持的假象。实验显示,Gemini 3 Pro等模型在真实场景表现不佳,还揭示了模型在语音交互中的三大失败模式。
清华朱军团队Nature Machine Intelligence:多模态扩散模型实现心血管信号实时全面监测
清华朱军等团队提出多模态生成框架 UniCardio,在单扩散模型中实现心血管信号去噪、插补与跨模态生成。它采用扩散模型和 Transformer 架构,结合持续学习范式,实验表现优,有望用于多领域。
全景视觉的Depth Anything来了!Insta360推出DAP,200万数据打造全场景360°空间智能新高度
Insta360等团队推出全景度量深度基础模型DAP,构建200万量级全景数据引擎,设计三阶段伪标签管线,在模型架构上也有创新,在多项测试中效果优异,项目代码与模型已开源。
员工吐槽“给 AI 擦屁股”更辛苦?揭秘企业 AI 提效的“悖论”与真拐点
InfoQ《极客有约》X AICon 直播探讨企业 AI 提效实战。嘉宾指出用工程化手段控制模型‘幻觉’、做好数据治理很关键。还讨论了模型使用、数据处理、提效感受、招聘标准、场景选择等问题。
比Gemini 3记得更多,谷歌新框架将上下文记忆干到了200万!
Google在NeurlPS2025大会推出结合RNN与Transformer的全新架构Titans,能扩展到超200万个token上下文。背后涉及Titans和MIRAS两篇论文,共同推进测试时记忆概念,实验显示新架构性能出色。
马斯克脑机接口意念控制机械臂!演示者获得钢铁之吻,理论上可控制一切
Neuralink官方视频中演示者已能用意念控制机械臂。升级实验将采用“双植入”方案,首位受试者或二次手术。受试者也主动探索新用法,2024 - 2025年Neuralink多项成果,下一阶段关注复杂神经功能。
与Banana Pro过过招,国产Libcom图像合成工作台开启Labubu漫游记
2025年AIGC热度再创新高,通用图像编辑大模型虽功能强大,但在细分领域有不足。上海交通大学牛力团队推出并升级了Libcom图像合成工作台,与Nano Banana Pro对比,其在图像合成上表现更稳定。
GPT-5得分不到0.4!法律+金融最大规模基准:1.9万+专家评估准则
新推出的PRBench基准可测AI在金融和法律领域表现。它有19356条专家评估准则,是该领域最大公开基准。顶尖大模型在困难子集得分低,还独创经济路径分析维度,约30%任务为多轮对话,揭示了AI在专业领域的不足。
震惊电影圈!好莱坞混了10年没出头,他把AI「烂片」做成23万粉爆款
人类首个AI创作型导演Josh Wallace Kerrigan,用GenAI工具构建Neural Viz外星宇宙,将AI视频缺陷变风格,打造出有23.3万粉丝的YouTube频道,获好莱坞关注,实现经济独立。