「世界模型Genie 3」共找到 8648 篇相关文章
2天1k多星!BAGEL横空出世:字节跳动发布全球首个多模态全能AI,开启智能新纪元!
字节跳动推出开源多模态基础模型BAGEL,有70亿活跃参数。它在多模态理解排行榜超顶尖开源模型,文本到图像质量与SD3媲美,还具备世界建模等能力,文中介绍其方法、特性及使用说明。
一键式训练端到端Agent,Qwen3+MCP工具集高效集成!
RLFactory是开源的端到端RL后训练框架,将环境与RL后训练解耦,有极致易用、高效训练等特点。它让用户专注奖励逻辑和工具配置,还能提升训练效率,用Qwen3和MCP工具可快速训练DeepSearch模型。
LeCun发布最新世界模型:首次实现16秒连贯场景预测,具身智能掌握第一视角!还打脸用了VAE
LeCun团队推出PEVA模型,让具身智能体学会人类“预判能力”,首次实现16秒连贯场景预测。它结合结构化动作表示与条件扩散Transformer,用真实数据训练,解决长时序问题,还能筛选最优动作。
里程碑!Artificial Analysis:Mac能跑的两款开源模型正式追上GPT-5
据Artificial Analysis报告,32B以下开源模型比肩GPT - 5。Qwen3.5 27B、Gemma 4 31B分别与GPT - 5中杯、小杯智能水平相当,虽知识全面性落后,但智能体表现和批判性推理进步大,硬件门槛低。
实测惊艳全球的Veo3!音画同步无敌,贵是有原因的
谷歌开发者大会推出的Veo3模型,具备强大文本和图像转视频能力,首次实现视频与音频同步生成。实测中,它生成的视频音画效果惊艳,但也有翻车情况,谷歌还给出提示词编写指南。
英伟达全新开源模型:三倍吞吐、单卡可跑,还拿下推理SOTA
英伟达推出专为复杂推理和agnet任务打造的开源模型Llama Nemotron Super v1.5,实现SOTA表现,吞吐量提至前代3倍,可单卡高效运行。它采用NAS优化架构,经多数据集训练,现已开源。
24张图,从GPT-2到gpt-oss,看OpenAI开源模型技术演进
2025年8月OpenAI释出gpt-oss-20b与gpt-oss-120b两个开源权重模型。文章梳理了从GPT - 2到gpt - oss的技术演进,拆解关键创新点,对比了与Qwen3的差异,介绍训练推理细节、实测体验及与GPT - 5跑分对比情况。
2025 年中丨大模型市场分析报告
这是《2025年中丨大模型市场分析报告》。指出基础大模型塑造计算未来,企业重心转向推理。Anthropic超OpenAI成市场头号玩家,开源模型采用趋缓,企业换模型重性能,AI支出从训练转向推理。
Gemini 3.0 登场后,哈萨比斯要「改造」Google 全系产品
Gemini 3.0登场引发热议,被视为Google近年最稳健升级。Google DeepMind CEO哈萨比斯谈其研发过程、团队推进能力等。新模型各方面提升显著,还将强化个性化、记忆等能力,Antigravity开发平台也备受关注。
一文读懂DeepSeek-V3.2核心技术DSA:API疯狂降价性能不减的背后
DeepSeek发布实验模型DeepSeek V3.2,引入自研稀疏注意力机制DSA,API价格最高降75%。DSA先筛选后计算,含闪电索引器和稀疏多潜在注意力两组件,分四步工作,权衡了精确性与速度。