「3D世界」共找到 2785 篇相关文章
网页智能体新突破!引入协同进化世界模型,腾讯AI Lab提出新框架
腾讯AI Lab提出WebEvolver框架,引入协同进化的世界模型,让智能体在真实网页环境中性能提升10%,突破现有基于LLM的网页智能体瓶颈,还通过实验验证了其有效性和对网页状态变化的预测能力。
基于 Qwen3-VL-Embedding-8B 实现文搜图语义内容检索的实战教程
文章围绕Qwen3-VL-Embedding-8B模型展开,介绍其核心特性、技术架构等,提供环境搭建、模型部署指南,给出文搜图系统架构及代码实现,还通过电商、社交媒体、企业文档三个实战案例展示应用,最后讲解性能优化与常见问题解决方法。
小扎狂砸3亿美金薪酬包!奥特曼放狠话:传教士终将打败雇佣兵
新智元报道,Meta挖走近十位OpenAI研究员,小扎砸3亿美金薪酬包。奥特曼内部喊话“传教士将打败雇佣兵”,抨击Meta挖人,还暗示评估薪酬方案。当前硅谷AI抢人大战白热化,人才薪酬暴涨。
参数破万亿!阿里Qwen3-Max-Thinking发布,编程能力“踢馆”Gemini与Claude
阿里发布总参数超万亿的Qwen3 - Max - Thinking,预训练数据规模达36T Tokens。在多项权威测试中表现优异,能与顶级闭源模型竞争。引入两项核心创新,千问App等已上新,网友认可其能力与更新速度。
刚刚,智元提出SOP,让VLA模型在真实世界实现可扩展的在线进化
智元具身研究中心提出SOP框架,可让VLA模型在真实世界实现可扩展的在线进化。它是颠覆性的机器人学习新范式,整合在线、分布式和多任务机制,构建闭环打破机器人认知时间边界。实验显示其性能优越。
腾讯王者归来:混元图像3.0登顶LMArena!一手实测全球最强图像AI
LMArena最新榜单显示,腾讯「混元图像3.0」在文生图任务中夺冠,碾压谷歌Nano banana和字节Seedream 4。它9月28日开源,性能对标闭源模型,有强大推理、语义理解能力,支持中英文长文本渲染。
实测 Google I/O 放出来的 Imagen4,不如GPT4o、甚至不如Imagen3。。
作者实测 Google I/O 推出的 Imagen4,发现它在生成封面图时审美和文字表达不佳。对比 Elo 评分及实际出图,在指令遵循、细节还原等方面,Imagen4 不如 GPT4o 甚至 Imagen3。
Meta视觉基座DINOv3王者归来:自监督首次全面超越弱监督,商用开源
Meta推出并开源视觉基础模型DINOv3,采用自监督学习,首次全面超越弱监督,可生成高质量高分辨率视觉特征。它在多任务表现出色,参数和数据量提升,还构建模型家族,已在多领域产生实际影响。
英伟达成开源新王?Nemotron 3全新混合专家架构,推理效率升4倍
北京时间今天凌晨,英伟达发布 Nemotron 3 系列开放模型,含 Nano、Super 和 Ultra 三种规模。Nano 已上线 Hugging Face,采用混合 MoE 架构,推理效率提升显著。该系列还具备多种核心技术和实用能力,相关工具和数据集也已开源。
36个月大逆转!他带着谷歌AI杀回来了,下一步世界模型
ChatGPT发布近36个月,哈萨比斯带领谷歌AI反攻,新发布的Gemini 3在多模型榜单登顶,表现优于GPT - 5。谷歌将其作为底层模型开放,增强现有产品,还考虑重启谷歌眼镜项目。谷歌正缩小与OpenAI差距,哈萨比斯预计5 - 10年实现AGI。