「视频渲染框架」共找到 2553 篇相关文章
AI能否「圣地巡礼」?多模态大模型全新评估基准VIR-Bench来了
来自日本高校和企业团队提出多模态大模型评估基准 VIR-Bench,用于评测 AI 对旅行视频中地理位置与时间顺序的理解。它将任务拆解,构建数据集,实验显示模型虽有改进但性能远未达标,指明了大模型进化方向。
一个月的活一周干完!英伟达世界模型训练速度飙升400%
英伟达世界动作模型 DreamZero 训练成本高、耗时长,无问芯穹与清华等推出的 RLinf 框架,从算子融合到 I/O 全链路系统级重构,使训练吞吐拉高近 4 倍,还解决多类性能瓶颈,保证训练效果。
RAG搜对了却答错?德国萨尔大学找到了真相丨ACL'26
RAG是大模型落地标配技术,但存在搜到文档却答错的痛点。德国萨尔大学等团队提出Disco - RAG框架,在‘搜’和‘答’间加入‘读懂’环节,已被ACL 2026主会录用,在多基准测试表现优异。
Claude Opus 4.7 配 Lovart:全套品牌设计只需点击 2 次,设计师可能不太需要了
Anthropic发布Claude Opus 4.7,作者用其搭配Lovart为公益项目「国宝回家」做品牌设计。Lovart上线新功能打通设计链路,Opus 4.7感知能力提升。二者配合完成海报、字体、视频等,虽有细节待完善,但已跑通工程化链路。
SVG性能比肩GPT/Claude,腾讯开源3B模型HiVG,让Token「懂几何」
腾讯混元团队开源仅3B参数的HiVG,它是面向SVG生成的层次化分词框架,减少63.8% token数量,多项指标超越GPT-5.2等闭源模型及8B级开源模型,还在人类评测中表现出色。
告别大模型“失忆”!人大开源MemSifter:轻量代理先思考再回忆,搞定长时记忆
中国人民大学团队提出全新LLM记忆管理框架MemSifter,打破长时记忆管理‘精度不够’和‘成本太高’的困局。它将记忆检索‘外包’给轻量级代理模型,采用任务结果导向的RL训练范式,在8个基准测试中超越现有SOTA方案。
字节全球首发AI技能商店:一句话生成Coze Skills,你的经验直接卖钱
在全球AI共识下,Agent Skill成新战场。字节扣子此次升级,推出Skill、长期任务,还全球首上线技能商店。Coze Skill可封装经验,长期任务能拆解目标,技能商店能让经验变现。此外还推出视频Agent SKill。
AI也能换岗了!Anthropic教智能体交接班,不怕长任务断片
Anthropic设计出长时智能体运行框架,让AI跨越数小时任务渐进式推进。其采用双智能体架构,结合环境管理方法,提升全栈Web应用开发稳定性,但仍有通用与多智能体架构选择等开放问题。
DreamArt!只需一张图,生成可动的可交互物体
生成可动物体是具身智能等领域关键挑战,现有方法有局限。北大团队提出DreamArt框架,从单张图像生成可交互可动物体,经三阶段流程,表现优于基线方法,不过也存在生成不符物理规律等问题。
想知道你的LLM API被过度收费了吗?隐藏的Tokens终于可以被审计了
马里兰大学CASE Lab团队研究商业不透明大模型服务(COLS),定义其风险,提出三层审计蓝图。还推出验证框架CoIn,能高效识别token数量膨胀,有可定制性且审计开销低,为构建信任提供技术支撑。