视频编码」共找到 1324 篇相关文章

开源动态7

谢赛宁也玩MC?开源全新世界模型生成多人一致的游戏视角

电子游戏推动AI发展,谢赛宁团队探索世界模型新方向,推出多人视频世界模型Solaris。该模型能生成多人一致的第一视角,团队还搭建了多人数据采集系统SolarisEngine,构建了多人Minecraft数据集。实验结果显示,其方法在多方面表现更优。

机器之心
算法论文8

RAG外部检索是多余的,英伟达最新成果颠覆认知

英伟达INTRA论文指出RAG架构中检索器和生成器在不同表示空间工作,存在retriever - generator mismatch问题。INTRA让模型用注意力查询检索自身编码表示,训练量小,在多跳QA上超越多种检索基线。

PaperAgent
新闻资讯8

全网挤爆Seedance 2.5,但2.0 fast降到6毛是真的香!

近期AI视频赛道竞争激烈,FLUX 3登场,国内巨头也纷纷推出新模型。字节Seedance 2.5优势明显,但适用特定场景。Seedance 2.0 fast降至6毛每秒,经多场景实测,表现均衡,是性价比之选。

新智元
产品应用8

这个Coding Agent框架要火!Cursor、Claud太慢了

AI Agent赛道爆发,开发编码代理效率低。新出的jcode框架将Coding Agent功能整合,解决痛点,内存效率高、启动快、资源占用少,还能为开发者省80%底层开发时间。这是赛道成熟信号。

CourseAI
开源动态8

谷歌AI Agent刚开源!多任务智能体+MCP+谷歌搜索,狂揽9000颗星

今天凌晨,谷歌在官网开源AI Agent框架Gemini CLI,将Gemini大模型融入终端。它能调用视频和图像模型,集成MCP、谷歌搜索等功能,还集成超强编码助手,刚开源就在Github超9000颗星。

AIGC开放社区
新闻资讯8

谷歌AI核爆:升级全系模型,Gemini 2.5双榜登顶!所有产品用AI重做,OpenAI如何接招?

北京时间5月21日凌晨,谷歌在2025 I/O大会发布众多更新。模型层面,为Gemini 2.5 Pro引入新推理模型和2.5 Flash;谷歌搜索推出AI模式;还亮相视频模型Veo 3,编码助手Jules公测等。

AI前线
开源动态8

万帧实时!流式3D重建天花板,被国产开源模型打破了

蚂蚁正式开源 LingBot-Map,这是基于几何上下文 Transformer 的纯自回归流式 3D 重建基础模型。它能在恒定内存下实现超万帧长视频实时三维重建,处理速度约 20 FPS,在多基准测试中超越现有流式方法。

机器之心
新闻资讯7

干家务一小时挣1000元,具身智能时代人类新岗位

机器人是AI热门领域,但面临数据荒。训练数据分真实与合成两类,前者质量高但成本高、规模有限,后者成本低。数据标注服务商高价回收做家务等视频作训练素材,各方努力下优质数据仍短缺。

量子位
开源动态7

2万开源项目已用上,OpenAI下了盘大棋,Cursor,Codex智能体纷纷支持

据彭博社消息,DeepSeek计划年底发布可自主执行多步任务、自我学习进化的AI Agent。OpenAI开源的AGENTS.md已获5k星,为编码智能体提供使用说明,还给出示例和使用指南,相关智能体已用于2万开源项目。

PaperAgent
新闻资讯7

3年增长54倍,ARR 50亿美金,它如何跑通“第二名”AI商业化难题

Anthropic从OpenAI分化而来,3年估值从34亿美元涨至1830亿美元,近期完成130亿美元F轮融资。它先技术突围探索Claude系列,后场景突围确定优势领域,在编码场景领先,与OpenAI发展模式不同,靠API服务企业。

鲸选AI