连续扩散语言模型」共找到 1394 篇相关文章

算法论文7

CodeClash 通过多轮编程竞赛对大型语言模型进行基准测试

为评估大型语言模型(LLM)编码能力,斯坦福、普林斯顿和康奈尔研究人员开发 CodeClash 基准测试,让多个 LLM 在多轮比赛中较量,涉及多种代码竞技场,还评估模型分析代码库能力,未来将处理更大代码库。

InfoQ
产品应用8

Agent大革命!Claude 4连续自动编程7小时,刷新世界记录

今天凌晨Anthropic召开开发者大会,发布Claude 4,含Opus 4和Sonnet 4。Opus 4编程智能体连续工作7小时破纪录,Sonnet 4在SWE - bench表现超前沿模型。还新增功能,Claude Code开放,API也有新特性,Sonnet 4免费但有限制。

AIGC开放社区
算法论文8

Lumina-mGPT 2.0:自回归模型华丽复兴,媲美顶尖扩散模型

上海人工智能实验室等团队提出Lumina - mGPT 2.0自回归模型,统一多种图像任务。它采用独立训练架构、统一多任务处理框架和高效推理策略,实验表现优异,后续将优化采样时间并扩展至多模态理解。

机器之心
算法论文8

全球首个,连续时间具身世界模型!任意帧率自由生成

来自清华AIR与UC Berkeley BAIR的团队提出全球首个连续时间具身世界模型ODEWorld。它学习世界在每个时刻的变化方向与速度,能任意帧率自由生成,统一了离散模型分散的生成能力。

新智元
新闻资讯7

官宣!姚顺雨出任腾讯首席AI科学家,带队大语言模型、AI Infra

12月17日腾讯官方消息,腾讯升级大模型研发架构,新成立AI Infra部等。姚顺雨出任首席AI科学家,兼任AI Infra部、大语言模型部负责人,他在智能体方向成果多,论文总引用超1.9万。

机器之心
推荐文章7

ACL'25首届博士论文奖 | 重新思考 LLM 中的数据使用

近日,第一届 ACL 计算语言学博士论文奖获得者是 Sewon Min,其论文《重新思考大型语言模型中的数据使用》围绕大型语言模型如何使用训练所用的庞大文本语料库展开研究。

PaperAgent
算法论文7

视觉优势还是语义依赖?揭秘 DeepSeek-OCR 高压缩率背后的真相

中科院等团队论文剖析 DeepSeek - OCR,通过实验揭示其高压缩率下准确率高或依赖语言先验。去掉语言先验,准确率暴跌;下游任务推理崩塌,长文本处理也有瓶颈。

深度学习自然语言处理
开源动态7

推出 AnyLanguageModel:在 Apple 平台统一本地与远程大语言模型的 API

语言模型是构建现代软件的重要工具,但 Apple 平台开发者集成模型困难。Hugging Face 发布 AnyLanguageModel,是 Swift 包,可替代 Apple Foundation Models 框架,支持多模型服务商,降低使用 LLM 难度。

Hugging Face
算法论文8

Nature Machine Intelligence颠覆有机化学研究范式,上海交大发表化学合成大语言模型

上交大AI4S团队依托平台,联合多团队在AI for Chemistry领域获突破。相关研究发表于《Nature Machine Intelligence》,介绍白玉兰化学合成大模型Chemma,它加速有机合成全流程,在多任务表现出色,还能解决数据稀疏等问题。

AI科技评论
新闻资讯7

耗时15年、扫描1400个大脑!她发现了藏在人脑中的「生物版ChatGPT」

MIT神经科学家Ev Fedorenko扫描约1400人大脑,识别出“生物版ChatGPT”——语言网络,它负责将词语与意义映射、拼成句子,揭示了语言与思维分离,研究发表在《Nature Reviews Neuroscience》。

新智元