3D画面控制」共找到 2505 篇相关文章

开源动态8

比SOTA快9倍,谷歌DeepMind时空重建,把视频变成时空搜索引擎

谷歌DeepMind联合团队发布D4RT时空重建框架,颠覆传统视频转3D方法。它按需提问,像搜索引擎,处理动态视频高效。内部结构分编码、解码两步,速度快,还发明聪明收割机算法,在多项测试中表现优异。

AIGC开放社区
算法论文8

真·开外挂!MIT新研究:架构0改动,让大模型解锁千万级上下文

MIT CSAIL团队提出递归语言模型RLM,不改动模型架构,让GPT - 5、Qwen - 3等模型具备千万级token超长文本处理能力。它将上下文处理“外包”,实验显示其处理规模超前沿模型,复杂任务优势显著,多数场景性价比高。

量子位
新闻资讯7

抨击AI炒作、曝企业需求为先,Anthropic 联创:模型提 0.01 性能就血赚,算力烧钱但值!

Anthropic由7位前OpenAI核心成员创立,联合创始人兼总裁Daniela Amodei接受采访,谈到成本控制、AI安全及上市可能。她认为AI安全是核心优势,公司谨慎对待支出和算法效率,虽算力投入大,但硬件回报高。

AI前线
算法论文7

Qwen负责人转发2025宝藏论文,年底重读「视觉领域GPT时刻」

2025年末,Qwen大模型技术负责人林俊旸转发谷歌DeepMind入选ICCV 2025的论文,指出视觉领域“GPT时刻”要来了。研究用实验数据证明,视频模型正跳出任务专属局限,实现一个模型完成多视觉任务,推理过程还能被CoF“演”出来。

量子位
开源动态8

白嫖微软开源Web Agent,独立开发者的第二双手:自动刷网页、跑脚本、盯进度,全交给 Magentic-UI

Magentic-UI是微软开源的Web Agent界面,能控制浏览器、执行代码等,解决长流程、重复且让人不放心全交给AI的任务。它可视化操作,有可复用计划图库等亮点,使用体验好,适合特定开发者。

小华同学ai
开源动态8

告别VAE压缩损耗,南京大学用DiP让扩散模型回归像素空间,实现10倍加速与SOTA级画质

南京大学、腾讯优图实验室和新加坡国立大学发布DiP框架,即将开源。该框架不依赖VAE,仅增0.3%参数量,推理提效10倍,在ImageNet获1.79的FID分数,解决扩散模型在像素空间难兼顾质效的问题。

AIGC开放社区
新闻资讯7

赢家诅咒?英伟达暴跌背后的泡沫之辩

11月3日至28日,英伟达股价跌幅近15%,黄仁勋有危机意识。同时谷歌股价涨超13%,Gemini3.0重建投资者信心。行业面临‘Scaling时代终结’论断,围绕英伟达GPU折旧周期有争议,TPU路线现曙光,国产算力加速替代。

芯师爷
开源动态8

NVIDIA 开源 Live VLM WebUI:摄像头实时测试视觉语言模型

NVIDIA 开源 Live VLM WebUI,可让用户在本地用摄像头实时测试视觉语言模型。它基于 WebRTC 技术,能将摄像头视频流实时传输给模型,分析结果叠加在画面上,支持多后端、多平台及多种模型。

AI工程化
新闻资讯7

国产先进封装的协同进程,究竟走到了哪一步?

AI算力浪潮下,产业焦点从‘制程竞速’转向‘系统协同’,Chiplet与2.5D/3D先进封装成关键路径。湾芯展上,硅芯科技牵头的‘Chiplet与先进封装生态专区’让国产先进封装协同具象化,展现产业链闭环能力。

芯师爷
开源动态8

LeRobot v0.4.0 正式发布:全面提升开源机器人的学习能力

LeRobot v0.4.0 正式发布,带来多方面重大升级。有可扩展的 Datasets v3.0、新 VLA 模型、全新插件系统;支持 LIBERO 和 Meta - World 仿真;还有数据处理 Pipeline、多 GPU 训练简化等特性,上线了机器人学习课程。

Hugging Face