3D世界生成」共找到 4450 篇相关文章

产品应用7

谷歌把电脑操作能力塞进Gemini 3.5 Flash!自己看屏幕狂点70轮

谷歌将电脑操作能力Computer Use内置进Gemini 3.5 Flash,该AI能通过看屏幕操作电脑,可执行点击、打字等动作。其覆盖网页、桌面软件和移动端,还加入安全约束机制,在基准测试中表现良好。

量子位
开源动态8

OpenAI未公开的o3「用图思考」技术,被小红书、西安交大尝试实现了

OpenAI推出的o3推理模型打破传统文字思维链边界,实现图像融入推理过程。小红书与西安交大联合构建多模态深度思考模型DeepEyes,尝试实现类似能力,还开源技术细节,在多任务中表现出色。

机器之心
开源动态8

3B小模型吊打72B巨头!轻量级文档解析OCR,性能超Gemini,高效且精准!

Yuliang - Liu团队在GitHub开源轻量级文档解析模型MonkeyOCR,以SRR三元组范式实现高效精准解析,3B参数模型在英文文档解析上超Gemini 2.5 Pro和Qwen2.5 - VL - 72B,还介绍了安装部署、适用场景等。

开源星探
算法论文8

智能体如何学会「想象」?深度解析世界模型嵌入具身系统的三大技术范式

长期以来具身智能系统缺预测力,世界模型让智能体有了‘想象’未来的能力。中科大等机构团队综述将现有研究划分为模块化、顺序、统一三大架构集成范式,并指出未来研究方向。

机器之心
开源动态8

Qwen3家族训练秘籍公开:思考/非思考融进一个模型,大模型蒸馏带动小模型

Qwen3技术报告揭晓8款模型关键技术,采用双模式架构,训练和微调分段进行,还“大带小”蒸馏数据。其融合思考与非思考模式,训练分多阶段,Qwen Chat还全量上线深度研究功能。

量子位
算法论文8

字节Seed提出M3-Agent:像我们一样"记住"与"思考"的长视频理解新范式

字节Seed提出M3 - Agent,这是首个融合实时视听输入、类人记忆构建与自主推理的多模态智能体。它模仿人类记忆机制,解决长视频理解痛点,已被CVPR 2025收录并开源代码,为通用人工智能奠定基础。

深度学习自然语言处理
算法论文8

统计可控数据合成!新框架突破大模型数据生成局限,麦吉尔大学团队推出LLMSynthor

麦吉尔大学团队提出新方法LLMSynthor,让大模型成结构感知的数据模拟器,为隐私敏感、数据稀缺场景生成不泄密的高质量替代数据。它通过结构推理、统计对齐等步骤实现,有理论保障,多场景实测效果佳。

量子位
算法论文8

突破显存瓶颈:基于 DeepSeek-V3.2-Exp 的 Latent Cache 卸载预取方案设计与模拟验证

百度百舸AIAK团队针对DeepSeek-V3.2-Exp,设计基于Latent Cache的卸载预取方案ESS。该方案解决显存瓶颈,提升Decode吞吐并降低成本,经模拟验证效果显著,未来将拓展应用。

InfoQ
开源动态8

这个项目专治建模手残党,给张图就能转变可编辑能转动的3D模型

img2threejs上线11天获4.8k Star,专治建模手残党。给它一张图,它让AI写代码把物体“搭”出来,不重建几何,也不下素材包,还省Token、零依赖,有严格质量门控。

GitHubStore
推荐文章8

从Transformer到Agent:生成式AI行业技术路线与职业发展指南,深度解析AI价值链

文章深度解析生成式AI行业,介绍其宏观图景、商业运作、行业定位与战略考量。指出行业价值链呈“杠铃”形态,应用层机会大,还提及盈利模式、岗位薪酬、开源闭源之争等,为从业者提供职业指南。

AI Reading Hub