「3D形象生成」共找到 3867 篇相关文章
图像模型今夜变天?谷歌刚刚泄露了「Nano Banana Pro」这张王牌
谷歌DeepMind CEO置顶「预告」,传言中的Nano Banana Pro登场在即。它基于Gemini 3.0 Pro级引擎,速度、画质大幅升级,懂界面排版,创作力强,有望让图像模型迈进「专业级时代」。
Google 把翻译能力彻底开源了!TranslateGemma:550种语言通吃,还能直接看图翻译!
Google将多年积累的翻译能力灌进开源大模型TranslateGemma,它基于Gemma 3,专为翻译任务调优,有3个规模版本,覆盖550种语言,能直接看图翻译,亮点颇多。
微信聊天记录喂AI(腾讯官方版)
用户可将微信聊天记录转发到元宝app,它能提供智能总结、分析等服务。在工作、生活、学习全场景都适用,如生成会议纪要、梳理旅游规划等,此前它还能总结微信文件、解读公众号文章。
Karpathy公开附议:AI Agent 的输出格式,正在从 Markdown 走向 HTML
随着 Agent 处理任务变复杂,Markdown 在长文档中可读性与排版局限凸显。HTML 能无损表达信息、支持双向交互,但生成耗时久、版本控制难。AI 研究者 Karpathy 附议,HTML 成探索方向。
ICLR 2026 Oral | 告别多步去噪!清华团队推出MVP,实现机器人动作单步极速生成
清华大学智能驾驶课题组 iDLab 与加州大学伯克利分校人工智能研究院 BAIR联合发表研究,提出 MVP 策略。它引入瞬时速度约束解决均值流学习问题,设计复合生成与选择机制,在多任务测试中表现出色。
蚂蚁多模态统一框架Ming-Omni:能看懂世界、会说话、还能画画
文章介绍蚂蚁多模态统一框架Ming - Omni,它可统一处理图像、文本等多模态数据。该框架解决了多模态训练中模态表示差异、收敛速度不一致等问题,采用分阶段预训练,能用于图像、音频生成及多模态交互。
谷歌偷偷上线免费Cursor,程序员饭碗又摔碎了!
Google AI Studio增加build按钮,相当于免费的cursor。能用一句话、图或文件生成完整AI应用并一键部署。可通过对话修改应用,分享应用消耗他人免费配额,利于推广Gemini生态。
NVIDIA开源“Banana”级黑科技!会懂物理、理解时间的图像编辑模型!
继谷歌Banana后,英伟达开源物理级图像编辑模型ChronoEdit - 14B,被称‘NVIDIA版的Banana’。它有‘时间观念’和‘物理常识’,能按描述生成符合物理规律图像,适用于多领域。
评论送书 | 奇点何时到来?AI会成为人类的威胁吗 ?
文章从非线性非平衡多自由度系统的视角,探讨生成式AI未来发展态势,对‘规模扩大至临界点会实现奇点’及‘AI成人类威胁’的观点存疑,指出人类滥用AI才是现实威胁。
突发!英伟达正式以129亿美金收购抱抱脸:不强制使用自家算力,马斯克送祝福
英伟达宣布以129.3亿美元收购Hugging Face,黄仁勋表示平台将保持独立开放,不强制用英伟达算力,坚持开放权重生态。英伟达会提供基建支持,保留其品牌,助其发展。