混合动态数据采集」共找到 2941 篇相关文章

算法论文8

腾讯混元 TurboS 技术报告首次全公开:560B 参数混合 Mamba 架构,自适应长短链融合

日前腾讯混元 TurboS 技术报告全公开。它是超大型 Hybrid Transformer - Mamba 架构 MoE 模型,有自适应长短思维链机制,总参 560B。在多榜单成绩亮眼,多语种和多任务处理能力强,还介绍了核心创新、训练策略等。

InfoQ
算法论文8

NUS LV Lab新作|FeRA:基于「频域能量」动态路由,打破扩散模型微调的静态瓶颈

在大模型时代,参数高效微调(PEFT)已成为迁移大规模扩散模型至下游任务的标准范式。但现有微调方法多采用「静态」策略,忽略扩散生成过程内在规律。新加坡国立大学LV Lab等机构提出FeRA框架,通过频域能量动态路由,实现高效微调。

机器之心
算法论文8

AAAI 2026 Oral | 拒绝「一刀切」!AdaMCoT:让大模型学会「看题下菜碟」,动态选择最佳思考语言

多语言大模型面临语言选择难题,现有跨语言推理方法存在缺陷。新加坡研究团队推出AdaMCoT框架,通过自适应路由机制动态选语言推理,提升跨语言事实推理准确性与一致性,效果超越传统方法。

机器之心
开源动态8

离谱……面壁让 AI 写了个训练框架,然后它自己训出了最强的 1B 模型:MiniCPM5-1B

面壁发布 1B 参数量级最强端侧文本大模型 MiniCPM5 - 1B,其 Base Model 由 AI 编写的训练框架 ForgeTrain 训出,速度超英伟达 Megatron 10%。该模型性能出色,部署门槛低,数据治理方案对应数据集也已开源。

AGI Hunt
新闻资讯7

英伟达为何持续押注VASTData?AI存储正在成为新的“算力”|甲子光年

AI产业曾聚焦GPU,如今数据存储设施重要性凸显。VAST Data完成约10亿美元F轮融资,估值300亿美元,英伟达持续跟投。它重构AI数据基础设施,国内焱融科技有相似技术路线且具自主可控优势。

甲子光年
新闻资讯7

GLM-5.2真正的跨越:CritPt密闭物理数据集测试得分20.9%,打平Opus-4.8

GLM - 5.2在CritPt密闭物理数据集测试中表现亮眼,与Claude Opus 4.8得分并列,远超其他开源模型,还击败多款闭源模型,实现4.5倍代际飞跃,标志开源模型科学推理能力进步。

AI寒武纪
新闻资讯8

突破三维感知瓶颈:魔芯科技发布VGGT系列成果,实现动态高保真重建并获新一轮融资

魔芯科技联合同济大学等团队,基于 VGGT 架构发布四项成果,突破三维感知在流式处理、动态鲁棒性和精细感知上的瓶颈。还获新一轮融资,后续将加大对空间智能与世界模型技术投入。

机器之心
新闻资讯8

万字实录:VLA 范式,具身智能的曙光与迷雾丨GAIR Live

2025年5月9日,雷峰网等举办“具身智能之VLA的实践与突破”线上圆桌沙龙。多位专家探讨VLA定义、起源、技术路线等,指出其面临推理、数据等瓶颈,还讨论了与强化学习结合、数据选择、提升泛化性、长程任务及落地场景等问题。

AI科技评论
开源动态8

颠覆传统向量数据库,直接将文本数据编码成视频文件,轻量级革命性的大规模AI记忆解决方案Memvid

Memvid将文本数据编码为视频,改变AI记忆管理,实现百万级文本块闪电语义搜索和亚秒级检索。它存储高效、轻量级、可离线,应用场景广,还给出安装、使用、配置等说明,并与传统方案对比。

GitHubStore
算法论文8

何恺明新作:给扩散模型加正则化,无需预训练无需数据增强,超简单实现性能提升

何恺明最新论文研究扩散模型与表征学习的联系,提出Dispersive Loss正则化方法。它无需正样本对,有高通用性、低计算开销等优势,在多模型测试中提升了生成质量,在其他任务也有潜力。

量子位