视频渲染框架」共找到 2569 篇相关文章

产品应用8

用完这张无限可能的AI画布,第一次感觉人类导演要失业了!

2024年7月上线后迅速风靡海外的SkyReels发布最新版本,它重构AI创作生态,打通「图片—音频—视频」全栈,集成多种功能于一张画布,还推出专家智能体,让普通人轻松创作高质量内容。

新智元
开源动态7

国产开源LLM大爆发,Qwen、Minimax、美团、腾讯~

近期国产开源LLM大爆发,Qwen3-VL家族新增模型,有技术亮点且可免费商用;MiniMax-M2为编码和代理任务打造;美团LongCat-Video、LongCat-Audio-Codec各有专长;腾讯混元世界 - 镜像用于3D几何预测。

PaperAgent
产品应用7

Spring AI Alibaba实践|后台定时Agent

文章参考Langchain,探讨Agent新运行形态,Spring AI Alibaba(SAA)为开发提供框架。介绍自主运行Agent优势、适用场景,说明构建方法,还给出店铺经营分析和评价舆情分析两个实践案例代码。

阿里云开发者
算法论文8

苹果传统强项再发力,视觉领域三种模态终于统一

苹果在大模型领域常受挫,但计算机视觉研究是其强项。其研究团队提出 ATOKEN,这是首个能在主要视觉模态统一处理的分词器,兼顾重建质量与语义理解,成果朝通用视觉表征迈进一步。

机器之心
开源动态8

人人都能炼专属Agent,上海交大开源端侧Agent全栈工具链,真实场景性能超GPT-5!

上海交大开源端侧Agent全栈工具链MobiAgent,将构建手机Agent全流程开放。它在真实场景性能超GPT - 5,还设计“潜记忆加速器”,通过三步养成Agent,评测表现出色,降低移动智能体开发门槛。

机器之心
算法论文8

综述 | Agentic RL for LLM的最新进展与未来挑战,idea满满

该综述对新兴的Agentic RL进行系统性总结与展望,介绍其与传统LLM - RL区别,从核心能力和任务视角阐述其应用,梳理支撑系统,指出核心挑战与未来方向,展示通向通用AI的希望之路。

深度学习自然语言处理
产品应用7

Google官方发布nano banana使用指南

Google官方发布nano banana使用指南,介绍其核心能力,如角色一致性、精确局部编辑等,还给出写提示词的6要素、5种实用技巧,同时指出模型存在风格化不一致、文字渲染易出错等问题。

AI工程化
新闻资讯8

波士顿动力 | 人形机器人Atlas ,最新研究进展!

世界人形机器人运动会引发对自主机器人的讨论。波士顿动力与丰田研究院合作为 Atlas 开发大型行为模型(LBM),使其能自主完成复杂任务,研究团队展示成果并介绍模型构建流程、实践成果及研发原则。

AINLPer
推荐文章8

美国知名风投 BVP 年度 AI 报告:Memory 和 Context 将是新的护城河

美国知名风投 BVP 发布《The State of AI 2025》报告,研究 20 家 AI 创业公司,梳理 2025 年 AI 创业现状,认为记忆和上下文是新护城河,还对未来趋势如浏览器竞争、视频生成等进行了预测。

Founder Park
开源动态8

Kimi K2技术报告正式发布:“保姆级”深度解析,一文读懂万亿参数智能体的所有秘密

Kimi K2技术报告发布,Moonshot团队用万亿+参数稀疏MoE架构等打造接近Claude - Opus的通用大模型。围绕训练稳定性等改进,有预训练、架构设计等多方面创新,为智能体领域提供可行路径。

AI寒武纪