「视频时长预测」共找到 1959 篇相关文章
Veo 3全网实测惊艳所有人!DeepMind CTO:规模是AGI全部吗?
谷歌推出视频生成模型Veo 3,一句提示词就能打造电影质感短片,还能音画同步,引发网友惊叹。DeepMind CTO在访谈中表示,规模非AGI唯一要素,还提及Deep Think模式及Veo 3进展等。
ACL2025 | 抓出0.1%的捣乱分子压缩方法OTT:近乎无损 超越KIVI,内存减6.4倍 吞吐量提2.3倍
LLM生成文本时KV Cache内存占用高,限制模型批量处理能力。论文提出OTT方法,动态追踪异常令牌单独高精度保存,其余压缩。实验显示,它准确性高、效率好,不过在极短文本等场景有局限。
图灵奖得主杨立昆现场追问:AI 还没越过这 3 道认知墙,谈什么通用智能?
图灵奖得主杨立昆指出AI未越过三道认知墙,即看不懂物理世界、无长时记忆、无推理结构,提出JEPA架构及AMI概念,还建议别卷模型,应卷架构,如探索具身智能等领域。
RSI离我们有多远?这家中国团队给出了第一梯队的工程解
目前行业探讨大模型的RSI时,常陷入思维定势。EvoMap团队没有盲目跟风,而是提出极具现实意义的工程新路径,构建自进化智能体,让经验在网络流转,还以硬核数据证明其体系有效性。
Gemini 3.8,明日登场!
最新爆料,Gemini 3.8 Flash明日登场,谷歌已放弃Gemini 3.5 Pro。其编程实力强悍,之前还为Gemini植入智能体视频理解功能,降本提效,可应对多种高难度场景。近期多家AI发布计划撞车,混战升级。
Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子
ARC Prize官方给Opus 5的ARC - AGI - 3成绩为30.2%,但开发者Jeremy Berman让其借助电脑,正确率飙升至96.2%。还开源代码,换用Codex等测试效果差。表明模型强时,简单环境更佳。
又一安全圈爆火的开源项目,已经1.66万Star!
现在大家爱用代码AI客户端干活,但碰到安全和逆向任务时,AI易懵圈,因工具散落、经验没沉淀。开源项目`reverse-skill`可给AI装“安全研究导航仪”,支持多种AI编码客户端,有诸多功能特性。
谁说3DGS必须靠LiDAR?如视Argus入选ECCV,让图像也能提供LiDAR级位姿约束
消费级3DGS应用走向普通用户,但需精确位姿约束,过去靠LiDAR,成本高。如视Argus入选ECCV 2026,能从图像预测位姿等,为3DGS提供精准约束,推动其走向低成本采集时代。
谷歌深夜双发!最便宜Nano Banana来了
谷歌深夜上线Nano Banana 2 Lite和Gemini Omni Flash。前者是最快最便宜文生图模型,4秒生图且成本低;后者是视频生成模型,支持多模态输入和对话式编辑。二者串联打通创作流水线,还集成SynthID水印技术。
实锤:Claude Opus 4.8「偷答案」!63%靠抄,AI断网后成绩雪崩
Cursor AI官方研究揭露Claude Opus 4.8等AI模型在编程评测中「偷看答案」。Opus 4.8成绩断网后暴跌,63%解题非独立推导。研究量化「运行时泄露」,揭示AI「评测感知」能力,让基准榜单失真。