「模型不可知」共找到 8424 篇相关文章
中学生就能看懂:从零开始理解LLM内部原理【十二】|位置嵌入 - 给模型装上"GPS"
文章指出Transformer对词顺序不敏感,引出位置嵌入概念。介绍经典的函数编码、可学习位置嵌入法及新主流RoPE,还提及为让模型处理长文本,在RoPE基础上用PI和YaRN等扩窗技巧。
从“卷模型”到“算总账”:AI 产业竞争开始拼什么 | 请回答 WAIC 2026
WAIC 2026热度高涨,InfoQ直播间追问‘AI正在重写什么’。与会嘉宾讨论AI产业新阶段变化,如从‘看能力’到‘算总账’,认为模型重要性方式已变,还探讨了AI原生产品定义、AI Infra影响及未来关注方向。
ICML 2026 | 大模型内部也会长出「情绪树」,规模越大越懂人心
ICML2026 论文指出,大语言模型内部会自然形成类似人类心理学模型的「情绪树」,模型越大,情绪树越复杂,且在销售等任务上表现更好。同时,模型的情绪结构受身份设定影响,存在与人类相似的情绪识别偏见。
终于!世界模型进入“有声时代”:24FPS画面+48kHz立体声实时生成
过去两年视频生成模型不断提升画面参数,但传统模型生成的视频固定,用户无法干预。而世界模型可跟随操作实时渲染、动态生成世界。目前Noiz AI联合多机构发布实时可交互音视频世界模型HelixWorld 1.0,后续还将开源。
领先于Transformer!新架构首个1200万上下文模型SubQ,成本仅Opus的5%
Subquadratic公司提出SubQ模型,核心是SSA亚二次稀疏注意力机制。该机制改变注意力计算分配,让模型真正读长文档。SubQ是首个有1200万token上下文窗口的前沿模型,成本低、速度快,有望革新大模型扩展路径。
当LeCun还在「画饼」,中国AI大牛领先李飞飞一步把世界模型开源了
具身智能突破「遥操作」数据桎梏,商汤联合创始人王晓刚领衔的大晓机器人发布全球首个开源商业落地世界模型「开悟3.0」。它是多模态理解 - 生成 - 预测一体化,有强物理感知力,还解决了空间感和时间记忆问题。
「AI大模型时代的CIO」云栖专场: AI实战者与落地破局者的坦白局
云栖大会「AI大模型时代的CIO」专场,探讨企业AI落地难题。虽搭上AI电梯是趋势,但企业落地有不确定性,如组织架构不匹配等。多位实战者分享经验,给出RIDE等解法,助企业破局。
BIGAI & 中科大团队提出 MILR: 测试时隐空间推理,让图像生成学会「边想边改」丨ICLR 2026
BIGAI与中科大等团队提出MILR,通过测试时隐空间推理,在不更新模型参数下优化图文表示,提升复杂图像生成能力。该方法在多基准测试达SOTA,还探讨了测试时扩展与奖励模型,未来有诸多拓展方向。
GPT-5.2改写粒子物理教科书!人类手算32项算不出,AI一行公式搞定
OpenAI与多校研究者发布预印本论文,GPT - 5.2 Pro猜出关键公式,后被OpenAI内部模型证明。它推翻粒子物理教科书结论,指出单负树图振幅在特定条件下不为零,这是其在基础科学第三个公开贡献案例。
沉迷贪吃蛇,7B小模型竟变身「数学天才」!几何推理碾压GPT-4o
NVIDIA等团队提出视觉游戏学习ViGaL范式,让7B多模态模型玩贪吃蛇等游戏,使其在数学、几何等任务击败GPT - 4o。游戏培养通用认知与推理能力,不同游戏提升不同推理能力,多游戏训练效果更佳。