自验证」共找到 1825 篇相关文章

开源动态8

华为新开源!扩散语言模型突破32K上下文,还解锁了「慢思考」

今年文本生成领域从回归向扩散语言模型转变,但长序列训练不稳定是痛点。华为发布 openPangu-R-7B-Diffusion,将上下文长度扩至 32K,在多基准创 7B 参数量级 SOTA,还解析了其技术革新。

机器之心
新闻资讯7

奥特曼想要一个「AI接班人」!劈柴:这一天会来的

近日,奥特曼曝「AI接班人」计划,认为AI近年能胜任OpenAI部门管理,最终覆盖企业流程。OpenAI企业客户破百万,其构想或为盈利拼图。但目前AI难取代CEO,奥特曼若被取代就去当农民。

新智元
开源动态8

清华、北大,上海交大等发布人机协同训练框架,让机器人零样本学会新技能

清华、北大等发布人机协同训练框架MotionTrans,能让机器人零样本学会新技能。它将人类数据翻译成机器人语言,构建数据集,经格式转换、速度调整等处理后训练模型,实验验证其有效性,且数据、代码和模型已开源。

AIGC开放社区
算法论文7

2篇论文,最新上下文工程技术一次性讲透!

上下文工程技术持续火热,文章分享10月两篇相关论文。ACE让模型给己写「战术板」,在多任务表现优;SA - ICL让LLM先搭框架再做题,在化学/物理准确率提升显著,还对二者做了横向对比。

CourseAI
算法论文8

NeurIPS 2025 Spotlight | 让检索、推理真正「合体」的小而强模型,AceSearcher来了

近期,多所高校研究团队发布 AceSearcher 模型,它是让同一语言模型在推理时兼任双角色的合作式博弈框架,以两阶段训练为骨架,将推理与检索结合,提升复杂检索任务效果,在多任务上表现出色。

机器之心
算法论文8

设计师大解放!清华发布「建筑平面图」动生成模型 | ACL'25

清华大学吕帅团队提出FloorPlan-LLaMa模型,采用回归生成架构与RLHF机制,解决传统平面图动生成模型‘指标优秀但实际不可用’痛点,提升生成式平面图设计质量与实用价值。该论文被ACL录用获领域主席奖。

新智元
算法论文8

其实,扩散语言模型在最终解码之前很久,就已确定最终答案

随着扩散语言模型(DLM)发展,它成回归(AR)模型有力替代。但实际推理慢于 AR 模型。研究者发现早期答案收敛现象,提出 Prophet 策略,实验显示其能在保持高质量生成时显著加速推理。

机器之心
开源动态8

视觉Token注入CLIP语义,走向多模态理解与生成新范式

腾讯ARC Lab等机构提出全新视觉分词器TokLIP,将低级视觉Token与高级CLIP语义结合,支持端到端回归训练,可接入LLM框架,降低计算与数据门槛,在多模态任务中表现优异,代码已开源。

量子位
新闻资讯8

训练数据量降低1万倍,谷歌提出超高质量数据主动学习方法

将大模型应用于特定领域需数据微调,但筛选高保真训练数据难度大、成本高。谷歌提出新主动学习筛选流程,能将训练数据规模降1万倍,还提升模型与人类专家一致性。经实验验证,该方法效果显著。

AIGC开放社区
推荐文章8

AI 基础知识从 0.5 到 0.6—— Transformer 架构为何能统治AI领域?

文章围绕Transformer架构展开,先介绍其诞生背景,对比CNN、RNN等模型,阐述其在多领域的核心地位。接着剖析工作流程、实现原理,包括QKV机制、多头注意力等。最后列举T5、GPT等常见架构模型,并提及通义千问3与MCP协议。

阿里云开发者