大模型训练」共找到 9479 篇相关文章

算法论文8

EasyCache:无需训练的视频扩散模型推理加速——极简高效的视频生成提速方案

近年来,扩散模型在视频生成领域广泛应用,但推理慢、算力消耗高问题突出。EasyCache是无需训练的视频扩散模型推理加速方案,在多模型实验中实现幅提速且视频质量几乎无损,为技术落地提供基础。

机器之心
产品应用8

AI Code要变天了,Meta首个代码世界模型登场!

Meta FAIR推出32B参数的代码世界模型(CWM),旨在探索世界模型如何改变代码生成和推理,code和mode已开源。在SWE - bench验证中表现优,能与更规模或闭权重的LLM竞争,还介绍了训练、数据集等情况。

PaperAgent
算法论文8

AI画手总是六根手指?阿/美团/上交首次系统量化扩散模型计数幻觉

阿德莱德学、美团和上海交通学团队首次系统研究扩散模型“计数幻觉”问题。构建CountHalluSet数据集套件量化该问题,揭示其与采样条件的关系,还提出JDM模型缓解计数幻觉。

量子位
开源动态8

群核科技开源两款空间模型,想解决 Genie3 没能彻底解决的问题

2025年8月25日群核科技举办TechDay,发布专注3D室内场景的空间模型,开源SpatialLM 1.5和SpatialGen。两款模型分别解决理解交互和空间一致性问题,有实际应用价值,还介绍了数据飞轮效应及模型相关问答。

Founder Park
产品应用8

华为曝光两黑科技!打破推理延迟魔咒,模型从此「秒回」

华为通过FusionSpec和OptiQuant两技术创新,对MoE模型进行推理优化。FusionSpec依托昇腾特点,将投机推理框架耗时降至1ms;OptiQuant支持灵活量化,为模型推理提供高性价比。

新智元
新闻资讯7

3个月融资亿元,流形空间证明世界模型也需要预训练 | 甲子光年

2025年5月武伟创办流形空间,成立3个月获亿元融资。他认为VLA是过渡方案,世界模型是AGI新基建。当下技术分显式物理建模和隐空间交互两派,流形空间做具身世界模型,从预训练做起,还将领域模型产品化。

甲子光年
算法论文8

模型人格可以被量化!Anthropic最新论文发现“辅助轴”,开辟人类控制AI全新道路

Anthropic等机构研究团队深入模型激活空间,发现模型人格可量化,存在“辅助轴”。沿此轴干预能预测、解释“人格漂移”,用“激活上限”技术稳定模型行为,抵御越狱攻击,开辟人类控制AI新道路。

AI寒武纪
新闻资讯8

双重突破:全球首个零售VLA模型来了!开源OpenWBT让机器人遥操门槛暴降!

2025北京智源会上,银河通用机器人展示端到端具身模型GroceryVLA,可在商超场景自主操作,具强适用性等五能力。还发布OpenWBT开源系统,降人形机器人遥操门槛,促产业发展。

量子位
开源动态8

全能高手&科学明星,上海AI实验室开源发布『书生』科学多模态模型Intern-S1 | WAIC 2025

7月26日,上海AI实验室在WAIC 2025上发布并开源『书生』科学多模态模型Intern-S1。它首创‘跨模态科学解析引擎’,在多学科专业任务上超越顶尖闭源模型,多模态综合能力领先主流开源模型

OpenMMLab
产品应用8

豆包模型 Seed 2.0,有点不一样

模型升级频繁令人审美疲劳,但豆包模型Seed 2.0不同,其核心是Skills调用能力。作者测试了它做的小红书长图文排版生成器和古文翻译器,还体验了APP“专家模式”,展现多模态理解优势。

刘言飞语