长度泛化能力」共找到 3441 篇相关文章

产品应用8

在WAIC现场,全球首个拥有「原生记忆力」的大模型亮相,但不是Transformer

在WAIC上,RockAI推出基于非Transformer架构Yan 2.0 Preview的多模态大模型,有原生记忆能力。它在性能指标上优势明显,其记忆机制接近生物方式,团队秉持理念推动离线智能,获硬件厂商关注。

机器之心
8

GPT-5实锤,悄悄上线代号「龙虾」!版本号曝光,实测编程惊人能改屎山代码

代号「龙虾」的神秘模型在WebDev Arena现身,网友猜测是GPT - 5,提前试用者称其编程能力惊人,能改屎山代码。多位用户表示其在代码生成等方面超越Claude,OpenAI或已秘密测试。

新智元
开源动态7

突发!Qwen更新模型,全面超越kimi k2,强的离谱,主打Agent

Qwen小更新非推理模型性能强劲,各项指标超kimi k2,与Claude opus 4持平,Agent能力亮眼。Qwen团队告别混合思维模式,新模型上线,独立训练两模型,新版本多方面提升,团队称还有大招。

AI寒武纪
产品应用8

一个重要的发布被忽略!Decart发布实时“Sora”,直播/游戏业迎来新变革

Decart推出全球首个实时、无限长度的AI视频模型MirageLSD,基于独创的“实时流扩散”技术。其响应时间低于40毫秒,攻克了“错误累积”和实现实时响应两大难题,还计划拓展应用及升级功能。

AI工程化
开源动态8

斯坦福开源复杂推理AI Agent,融合超10种工具

传统AI助手应对复杂任务能力有限,斯坦福开源OctoTools,这一复杂推理AI Agent融合11种工具。它在16项基准测试中准确率高,能应对多领域复杂场景,框架含工具卡片、规划器等构件。

AIGC开放社区
算法论文7

SnapMoGen:44 小时动作数据 + 12 万文本注释,文本驱动动作生成数据集

近年来文本驱动动作生成有进展,但受限于数据集质量。Snap团队提出SnapMoGen数据集和MoMask++模型。前者有2万条动作片段和12.2万条文本描述,后者建模更有效,还结合LLM提升适用性,但二者都有局限。

带你学AI
推荐文章7

当你感到AI编程无所不能时,也许正站在“愚昧之巅”——理性看待AI时代的软件开发与应用变革

文章分析AI时代软件开发、产品设计和内容营销的变化。赞同产品设计半开放式、加速MVP效率等;部分赞同VOC捕捉、SEO自动化等,但有待验证;不认同普通开发者被淘汰等过于乐观的预测。指出多数变化5年渐显。

宝玉AI
算法论文8

LLM「拒绝回答」难题有救了!最新研究让AI学会人情世故 | COLM'25

最新研究发现模型规模和通用语言能力与处理敏感内容判断能力无直接关联,开源模型表现不错。通过提出的训练方法,在非推理和推理型模型上缓解过度拒绝问题,提升AI实用性和可靠性。

新智元
算法论文8

下一代AI需要「思想微积分」!华人团队重磅揭秘,AI方法论三连发

来自美国两所大学的华人团队发布「AI方法论三部曲」,提出「能力实现率(CRR)」模型、「认知几何学」框架,指出处于AI的「元语言时刻」,未来迈向「思想微积分」时代,从多维度构建理解AI的世界观。

新智元
推荐文章7

「Tokens是胡扯」,Mamba作者抛出颠覆性观点,揭露Transformer深层缺陷

Mamba作者Albert Gu在博客中探讨状态空间模型(SSM)和Transformer权衡,抛出‘Tokens是胡扯’观点,揭露Transformer深层缺陷,如分词问题、处理噪声能力弱等,还分析两类模型特点及结合优势。

机器之心