自回归模型」共找到 8275 篇相关文章

算法论文8

Meta联合Google新作:语言模型到底“记”了多少东西?

Meta和Google合作的论文探讨现代语言模型对训练数据的“记忆”情况。研究发明新方法精确测量“记忆”量,发现模型记忆有上限且与参数线性相关,还揭示学习转折、隐私规律等重要结论。

深度学习自然语言处理
新闻资讯7

Anthropic 断供,国产 Coding 模型的中场战事开启

Anthropic对中国企业断供,国产模型面临成为Claude平替的机遇。Kimi等模型纷纷尝试,Kimi K2 0905版本在编码、上下文及工具调用上提升,其终极目标或构建具Agent特质产品,未来Agent是决胜场。

Founder Park
开源动态7

Agent 下半场:真正能进化的 Agent 应该是什么样的?

当下 Work Agent 难以稳定完成复杂长程任务,且经验无法沉淀。EvoMap 提出组织蜂群架构,通过 AutoResearch 落地验证,探索 AI4AI 方向,构建记忆和连接的三层产品结构,推动 Agent 网络进化。

特工宇宙
开源动态8

Meta开源首个320亿参数代码世界模型CWM

Meta FAIR发布320亿参数的研究模型Code World Model (CWM),用“世界模拟”方式处理代码,试图真正“理解”代码逻辑。它在Math - 500数据集测试成绩亮眼,模型权重开放,可多渠道下载。

AI工程化
产品应用7

世界模型的新用途:不做选手,去当裁判

眼下具身赛道都在抢着做机器人的“大脑”,而地瓜机器人发布的世界模型Uranus却剑走偏锋,做机器人开发的基础设施。它能更客观地评测VLA和世界模型,还能做机器人训练的“场地”。

量子位
新闻资讯7

扩散不死,BERT永生!Karpathy凌晨反思:回归时代该终结了?

苹果前员工Nathan Barry得出BERT本质是文本扩散一步的结论,将表示学习算法改造成生成算法。OpenAI创始员工Karpathy对此沉思,认为生成逻辑在LLM架构中可变。实验证明RoBERTa可转为生成引擎。

新智元
算法论文8

“坏”数据让模型更“好”?重新审视数据过滤

传统观点认为大型语言模型预训练应过滤“坏数据”,但论文《When Bad Data Leads to Good Models》提出反直觉观点,适度加入有毒数据,通过后训练技术可降低模型毒性,保持一般能力,挑战常规做法。

深度学习自然语言处理
算法论文8

Meta提出StepWiser,让模型学会“反思”己的推理过程

Meta提出StepWiser解决大语言模型推理逻辑正确性问题。它训练生成式评判模型,通过强化学习在线训练,能解释推理步骤好坏。实验显示其远超传统方法,为构建可靠AI系统提供新思路。

深度学习自然语言处理
推荐文章8

YOLOv8 模型训练入门指南:手把手搞定目标检测AI

本文是从零训练 YOLOv8 模型的完整实录,介绍了 YOLOv8 特点,以“识别猫”为例,详述训练步骤,指出训练难点,还推荐学习资源与工具,鼓励前端程序员尝试做 AI 模型训练。

AI Reading Hub
新闻资讯7

金融智能体真的是大模型落地“最后一公里”?

InfoQ《极客有约》X AICon 直播栏目邀请业内人士探讨金融 AI 大模型实践现状。指出大小模型融合是主要方案,智能体有应用但也有问题。还分享了评估 AI 项目的要点、智能体应用案例及未来布局方向。

InfoQ