「语言建模」共找到 1325 篇相关文章
简单即强大:全新生成模型「离散分布网络DDN」是如何做到原理简单,性质独特?
本文作者杨磊介绍全新生成模型离散分布网络DDN,它建模目标分布机制简洁独特,有零样本条件生成等特性。文中详述其原理、网络结构、损失函数,还展示实验效果,最后给出未来研究方向。
AI 性格失控等诡异现象,终于有了科学解释
Anthropic新研究发现控制语言模型「性格特征」的人格向量,解释AI恶意、谄媚等现象。研究开发自动化流程生成向量,通过实验验证其对模型行为的控制,还有监控、防护等功能,不过也引发争议。
最强MCP开源:Windows-MCP
Windows MCP 是轻量级开源项目,能让 AI Agents 与 Windows 无缝集成。它弥合大语言模型与 Windows 差距,可执行文件导航等任务,有诸多关键特性,还给出在 Gemini CLI 和 Claude Desktop 的配置方法。
自我进化Agent综述:通往超级智能的进化之路
当前大型语言模型面对新知识、动态环境时存在固定参数瓶颈,自进化智能体研究应运而生。本论文作为该领域首部系统性综述,提出革命性框架,解析自进化智能体技术脉络与未来挑战。
DeepMind掌门自曝AGI倒计时5年!算力需求暴增10倍,推理计算吞噬一切
在最新播客中,DeepMind掌门Hassabis表示自然界规律能被机器学习算法模仿。他畅想AGI应用于游戏,还提及迈向AGI要扩大计算规模,算力需求或增10倍,且运营上以初创公司模式兼顾研究与产品。
模仿学习新范式!Chain-of-Action:轨迹自回归实现动作推理
具身智能领域尚未迎来「GPT时刻」,现有模仿学习范式有缺陷。字节跳动与阿德莱德大学研究者提出「动作链」(CoA)策略,通过轨迹自回归建模解决累计误差,提升泛化性,实验效果显著。
突破全模态AI理解边界:引入上下文强化学习,赋能全模态模型“意图”推理新高度
在多模态大语言模型应用多元的当下,对模型理解人类意图需求迫切。阿里巴巴通义实验室团队推出HumanOmniV2,解决现有推理路径问题,其相关代码等开源,在多基准数据集成果突破性领先。
彻底戳穿AI「失忆症」!超越OpenAI全局记忆,中国队开源LLM记忆操作系统
大语言模型有「记忆」缺失问题,国内顶尖团队打造出操作系统级AI记忆框架MemOS并开源且可商用。它将「记忆」升为「一级资源」,用MemCube封装记忆,评测显示性能优于OpenAI全局记忆方案。
Stream-Omni:同时支持各种模态组合交互的文本-视觉-语音多模态大模型
中国科学院计算技术研究所团队提出文本-视觉-语音多模态大模型Stream-Omni,能支持多种模态组合交互。它对各模态关系针对性建模,实现高效灵活的模态对齐,仅用少量语音数据就有多种交互能力。
拯救P图废柴,阿里上新多模态模型Qwen-VLo!人人免费可玩
昨夜阿里推出全新多模态模型Qwen-VLo,在原有能力上全面升级,有细节捕捉、图像编辑、多语言支持等亮点,不受固定格式限制。官方demo展示多种玩法,目前免费可玩,实测其编辑能力不错。