「输出质量」共找到 903 篇相关文章
3 天上了两个 SOTA 模型,视频 Agent 们接得过来吗?
7月31日MiniMax H3和字节跳动Seedance 2.5同日发布,3天后H3开源,8月7日Seedance 2.5开放api。模型变强使产品层要做的事更多,视频Agent需解决生产问题,竞争走向模型层之上。
VLM会描述视频,却未必用对参考图:RefCaptioner让参考图与视频语义精准对应
多模态大模型处理多参考图与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考图识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。
拖更三年,北大校友翁荔最新长文刷屏!
前OpenAI副总裁Lilian Weng发布拖更三年的长文《Scaling Laws, Carefully》,指出AI行业依赖的Scaling Laws远比想象脆弱。OpenAI和DeepMind对算力分配结论相反,且Chinchilla方法论也有问题,同时数据快用完,经典公式前提在崩塌。
Codex+hyperframe做视频,让剪辑师们慌了?
开源项目Hyperframes刷屏,它是基于HTML的视频渲染框架,不用视频大模型,用普通语言模型就能生成可控视频。它与Remotion有区别,选了对AI友好的路,还介绍了安装、使用方法和适用场景。
Cloudflare 构建了面向 LLM 的高性能基础设施
Cloudflare发布全新基础设施,可在全球边缘网络运行大型AI大语言模型。它将模型输入处理与输出生成拆分,自研Infire推理引擎,还推出Unweight模型压缩系统,分享提示词缓存优化方案。
打破碎片化瓶颈!浙大&哈佛开源UniGeo,高保真相机可控编辑
当前主流相机可控图像编辑基于图像扩散模型,应对连续相机运动易出现问题。近日,浙大联合哈佛发布UniGeo框架,在三核心层面注入统一几何引导,克服结构退化,提升视觉质量与跨视角一致性。
跑分第一,推理暴跌!Claude Opus 4.7上线48小时口碑崩了
Claude Opus 4.7发布48小时口碑两极撕裂。官方榜单并列全球第一,但逻辑推理公开测试成绩暴跌,token消耗涨35%,旧接口报错,用户吐槽「更贵、更蠢、更爱顶嘴」,Anthropic虽解释却难平用户怒火。
Claude Opus 4.7连夜突袭:或将抢走全球7亿打工人饭碗!
Anthropic正式发布Claude Opus 4.7,定义为当前可广泛使用的最强Claude模型。其核心升级在复杂任务执行、高清视觉理解和长链路工作流,视觉能力大幅提升,在多方面超越对手,普通用户使用有三大变化。
智源:ArXiv CLI重磅开源!2亿+开放论文,即将化身科研智能体的技能包
智源研究院联合高校与社区开发者研发的 DeepXiv 开源并免费开放。它是面向智能体的科技文献综合性工具集,提供数据接入、一站式能力集成、丰富接入形式等核心能力,还通过实战演示展示其在科研任务中的价值。
CVPR 2026 | 给扩散模型装上「物理引擎」: 北大彭宇新团队提出NS-Diff,使扩散模型学会流体与刚体力学
北大彭宇新团队提出 NS - Diff,将物理约束与强化学习结合,解决视频生成物理失真问题。它通过多模块提升视频物理真实感,实验表明在多数据集上超现有方法,降低物理运动误差。