视频渲染框架」共找到 2554 篇相关文章

开源动态7

Skills的最正确用法,是将整个Github压缩成你自己的超级技能库。

文章指出重复造轮子不可取,Skills可将Github开源项目封装成技能库。以FFmpeg、yt - dlp等为例,介绍封装流程,还提及多场景应用,如视频下载、格式转换等,让普通人能利用开源成果。

数字生命卡兹克
算法论文8

生成式推荐补上关键一环!语义ID首次实现可微分联合优化 | SIGIR'26

生成式推荐依赖语义ID,可现有语义ID常先学好再冻结,与推荐目标不一致。论文DIGER首次将可微分语义索引机制引入生成式推荐框架,让推荐损失参与语义ID学习,还设计策略解决训练问题,实验表现佳。

新智元
开源动态8

对标GPT-4o和香蕉!浙大开源ContextGen:布局身份协同新SOTA

浙江大学ReLER团队开源ContextGen框架,攻克多实例图像生成中布局与身份协同控制难题。基于Diffusion Transformer架构,用双重注意力机制实现布局精准锚定与身份高保真隔离,在基准测试中超越开源SOTA模型,对标GPT - 4o等闭源系统。

新智元
开源动态8

MiniCPM-o 4.5 技术报告发布:全双工全模态 API 开放,RTX5070即可实时运行

面壁智能联合多机构发布 MiniCPM-o 4.5 技术报告,公开 Omni-Flow 框架。该模型 9B 参数实现端到端全双工全模态,开放在线 Demo、API 等,最低 12GB 显存 GPU 可运行,在多维度评测表现出色。

AI科技评论
产品应用8

一款产品,同时为人类和 Agent 设计,LibTV 是怎么做的?

3月18日,LiblibAI旗下AI视频创作平台LibTV上线,它从设计之初就兼顾人类创作者和Agent。创作者端工作流画布可控;Agent端可通过Skill接口创作,交付可编辑项目。该产品还针对两者差异做了设计,价格也便宜。

Founder Park
算法论文8

JCP | 南科大邹欣桐、王建春等:神经算子在三维湍流预测中的不确定度和稳定性分析

本文以三维各向同性湍流为例,提出面向神经算子的可信度评估框架,考察预测误差不确定度、长时迭代稳定性及流场时间相关性对模型可靠性的影响。结果显示,物理约束和合理时间步长可提升模型稳定性与可靠性。

力学与人工智能
产品应用7

MultiAgent架构实践:如何打造GitHub Stars 2.8k的ComfyUI-Copilot V2.0

ComfyUI是Stable Diffusion生态中可视化编程工具,但使用有难度。ComfyUI - Copilot V2.0基于多智能体协作框架构建,能实现对话开发、报错修复等功能,还介绍了其架构、技术栈及多智能体设计思路等。

开源星探
产品应用7

海螺新模型海外爆火:一夜之间,猫、羊驼、长颈鹿都学会跳水了

国内AI公司Minimax的新模型‘Hailuo 02’本周三官宣上线,在海外爆火。其生成的动物跳水等复杂运动视频AI痕迹不明显,官方称它是全球唯一能处理类似体操高度复杂场景的模型。该模型使用NCR架构。

机器之心
算法论文7

一张俯视图,竟然能生成完整3D小镇?

获取高质量3D场景成本高、耗时长,现有3D生成模型扩展到完整场景生成时问题多。加州大学提出无需训练的3DTown框架,能从单张俯视图合成真实连贯3D场景,虽有挑战但表现优于基线方法。

带你学AI
8

挺意外的,Agent长期记忆潜力被AMemGym挖出来了

论文提出交互式在线策略评测框架AMemGym,它能反映AI助手长期记忆能力、驱动Agent自我进化记忆。它以结构化状态演化为骨架支撑自由对话评测,还对主流记忆系统做了扫描,带来评估与训练范式转换。

PaperAgent