「物理图灵测试」共找到 2142 篇相关文章
Temperature Scaling可大幅提高Test-Time Scaling瓶颈!
大型语言模型解决复杂推理问题时,测试时扩展(TTS)是提升性能的途径之一。但传统TTS依赖增加样本数量,性能提升有瓶颈。本文提出温度缩放新思路,实验表明其能大幅提升性能,还给出降低成本方法。
AI版抖音来了
OpenAI发布Sora 2及专门APP,被称为AI版抖音。Sora 2在逼真度和物理准确性上有极大提升,APP玩法独特,让大量真实人物与虚拟场景结合。虽仅在美加开放且需邀请码,但闲鱼已有售卖。
Sora 2 中国首测?Open AI 这次真成了!
OpenAI提前发布Sora 2模型,可克隆音色,支持多语言。还推出似AI版抖音的社交APP,免费生成视频。测试显示,它有世界知识,能多参生成、自动切镜头,在多方面表现出色,但版权限制严,部分一致性待提升。
刚刚,李飞飞空间智能新成果震撼问世!3D世界生成进入「无限探索」时代
斯坦福大学教授李飞飞创业公司 World Labs 发布限量开放测试预览版空间智能模型 Marble。输入单张图片或文本提示,它就能生成可无限探索的 3D 世界,与谷歌 Genie 有显著区别,还支持导出高斯点云等。
微软开源3大突破AI Agent模型,仅140亿参数超越DeepSeek-R1
微软研究院开源AI Agent推理模型rStar2-Agent,140亿参数在多测试超6710亿参数的DeepSeek-R1。其通过智能体强化学习,在训练基础、算法、流程上有三大突破,显著提升性能且降低算力成本。
可灵 2.1 首尾帧藏师傅外挂教程:两张图→大片,附万能提示词
作者分享可灵 2.1 首尾帧模型测试与使用教程,解决图片和提示词生成难题。介绍三种拿图法,给出 AI 生成提示词方法及原则,还指出可将流程固化、特效升维,提升视频创作效率与价值。
破解「长程智能体」RL训练难题,腾讯提出RLVMR框架,让7B模型「思考」比肩GPT-4o
腾讯混元AI数字人团队提出RLVMR框架,将‘元认知’理论引入RL,通过奖励‘好的思考过程’解决长程任务中智能体的低效探索与泛化难题,经其训练的7B模型表现出色。
OpenAI没开源的gpt-oss基础模型,他去掉强化学习逆转出来了
OpenAI未发布gpt-oss基础模型,Cornell Tech博士生Jack Morris自行逆转gpt-oss模型强化学习,发布gpt-oss-20b-base。该模型可生成任意文本,但不再对齐,还测试了其记忆能力,介绍了诞生原理与技术细节。
The Batch: 859 | Qwen3 的自主智能新进展
不到两周前 Kimi K2 超越其他开源非推理模型,如今阿里巴巴发布基于早期 Qwen3 - 235B - A22B 的三款新大语言模型权重,介绍了输入输出规格、架构设计、性能表现、使用方式等,还进行了性能对比。
谷歌DeepMind深夜放核弹:世界模型Genie 3登场,重新定义“生成式AI”
谷歌DeepMind推出第三代通用世界模型Genie 3,能生成多样化交互式环境,可实时导航。它较前代有诸多突破,有模拟物理特性等核心能力,能赋能具身智能体研究,但也存在行动空间有限等局限。