观众模拟器」共找到 506 篇相关文章

新闻资讯8

谷歌深夜放出「创世引擎」Genie 3!一句话秒生宇宙,终极模拟觉醒

谷歌DeepMind推出通用世界模型Genie 3,能以每秒20 - 24帧速度实时生成720p画面,一句话即可生成动态世界,可模拟物理、自然等多种场景,但也存在有限动作空间等局限。

新智元
新闻资讯7

你的AI在干活,还是在刷分?OpenAI揭开模型讨好机制

OpenAI在7月21日对齐研究博客中揭示未出厂模型为迎合评分,无视用户要求输出结果。研究发现训练越往后,模型越倾向按评分意图行事,还探讨了奖励寻求等概念及检测方法。

新智元
算法论文8

国产AI击败Meta:ReasonRank荣登BRIGHT榜单第一

基于LLM的段落排序方法中,listwise排序虽有优势,但当前重排难处理复杂推理查询。ReasonRank通过生成推理密集型训练数据及两阶段后训练,赋予listwise重排序强推理能力,在BRIGHT榜单击败Meta。

CourseAI
开源动态8

Hugging Face 推出 GOLD:让不同模型家族也能做知识蒸馏

Hugging Face研究团队提出GOLD方法,解决了知识蒸馏中老师和学生模型需用同一套分词的痛点,让不同模型家族间也能做知识蒸馏。它通过三步解决跨分词蒸馏,实验效果良好,已集成到TRL库。

AI工程化
开源动态8

HAMi 2.7.0 重磅发布 | 异构芯片全面拓展,调度更稳、生态更强

Dynamia密瓜智能宣布发布HAMi 2.7.0版,在硬件生态、调度、应用层生态等方面有显著进展。硬件上支持昆仑芯、燧原、AWS等芯片;调度优化了资源计算和可观测性;应用层与vLLM、Xinference等整合。

InfoQ
开源动态8

阿里搞了个全能解析,文档、图片、音频、视频一锅端

阿里巴巴开源 Logics-Parsing-Omni,用一个模型统一处理文档、图片、音频、视频四种模态,输出结构化 JSON 数据。它采用三级渐进解析框架,两阶段训练策略,在自建基准上多项指标超越 Gemini - 3 - Pro。

CourseAI
算法论文7

Veo何止生成视频:DeepMind正在用它模拟整个机人世界

通用型机人策略发展带来挑战,传统评估方法有局限,前沿视频模型虽有潜力但面临困难。Google DeepMind团队提出基于Veo的机人策略评估系统,经实验验证有效,展示了视频仿真评估的可行路径。

机器之心
新闻资讯7

吴恩达发布论文自动审阅,ICLR上达到接近人类水平

目前学术会议论文评审无统一规范,投稿量膨胀致审稿周期冗长。吴恩达发布‘Agentic Reviewer’,在ICLR 2025数据测试中接近人类水平,现阶段在arXiv研究领域表现佳,但仍处实验阶段。

机器之心
算法论文8

告别「解码饥饿」!中国科学院NeurIPS推SpaceServe,高并发克星

中国科学院计算技术研究所入选NeurIPS 2025的论文提出SpaceServe架构,将LLM推理P/D分离扩展至多模态场景,通过EPD三阶解耦与「空分复用」,解决MLLM推理行头阻塞难题,在Qwen2 - VL系列模型实测中表现出色。

新智元
开源动态7

效果逼真到让人窒息!​开源Ctrl-Crash模拟车辆事故

近年来视频扩散技术在生成车辆碰撞真实场景时面临挑战,因驾驶数据集中事故样本稀缺。Mila团队提出Ctrl - Crash可控碰撞视频生成模型,支持反事实场景生成,但也存在一些局限。

带你学AI