「通用世界模型」共找到 8372 篇相关文章
GPT-5.4 vs Opus 4.6 vs Gemini 3.1:五条结论
2026年3月前沿AI竞争激烈,GPT - 5.4、Opus 4.6、Gemini 3.1 Pro各有千秋。GPT - 5.4领先知识和计算机使用,Gemini 3.1 Pro以低价主导推理,Opus 4.6编程能力强,无单一模型通吃各领域。
ChatGPT开始预测用户年龄,NSFW内容要来了!
OpenAI于1月20日更新推出年龄预测功能,通过分析用户多方面信息判断是否为18岁以下。网友测试发现猜测较准,这或使NSFW内容限制放宽,不同模型版本情况有别,更新还改进语音和记忆功能。
破除水军机器人!北航团队发布全新对抗性框架SIAMD:用“结构信息”破译机器人伪装|IEEE TPAMI
本文介绍北航彭浩团队发表在TPAMI 2025的文章,提出对抗性框架SIAMD检测机器人。它将用户账户与消息交互组织为异质结构,用结构熵建模。实验显示,其在有效性、泛化性等方面优于基线模型。
谷歌翻译重大更新:实时翻译,全球无障碍交流摩擦苹果
Google搜索产品副总裁宣布Google翻译引入Gemini模型,翻译能力飞跃。更新含顶尖文本翻译、实时语音对话翻译(Beta版)及扩展语言练习功能,适用多平台多语言,谷歌期待用户反馈以优化体验。
全公司禁用Claude Code,CEO放狠话逼宫A社!
Shopify CEO Tobi Lütke考虑禁止公司使用Claude Code,除非其支持读取AGENTS.md和.agents/skills。Claude Code团队称正在改进,但坚持自有体系。AGENTS.md获众多工具支持,A社是相关基金会创始方,Claude Code却未原生支持。
让龙虾看懂屏幕!谷歌多模态新成果,文本图像视频音频进同一空间
谷歌发布首个原生多模态嵌入模型Gemini Embedding 2,将文本、图像、视频、音频和文档映射进同一嵌入空间,支持多模态混合输入,为AI Agent“看懂”世界提供关键基础,已展开公测。
Gemini 3来了,Software 3.0也快了
作者认为Gemini 3是目前最好的模型,编程时前端用Gemini 3,后端用Codex。无编程需求时,它也能助力信息处理。Google推出Generative UI,二者结合让我们接近Software 3.0。
NeurIPS 2025|VFMTok: Visual Foundation Models驱动的Tokenizer时代来临
传统视觉 Tokenizer 存在缺乏高层语义信息、冗余度高、表征混乱等问题。香港大学 CVMI Lab 和阶跃星辰 AIGC 团队提出 VFMTok,用预训练视觉基础模型构造视觉 Tokenizer,实验显示其性能优异。
从「会说」迈向「会做」,LLM下半场:Agentic强化学习范式综述
过去LLM训练多依赖PBRFT范式,但局限明显。2025年初起,Agentic RL新范式受关注。此综述论文梳理该方向,覆盖500+研究,构建理论框架,讨论未来挑战,助LLM从「会说」迈向「会做」。
入职OpenAI啦!这是我的AI Research面试指南
作者分享入职OpenAI的面试经历、经验与建议。涵盖身心调适、通用建议、各环节应对技巧等,如提前准备、与朋友模拟、注意设备和细节等,助读者应对AI Research面试。