模型能力提升」共找到 9790 篇相关文章

开源动态8

破解空间智能数据稀缺难题,影石开源DiT架构全景生成模型,在线可玩

影石研究院团队推出基于DiT架构的全景图像生成模型DiT360,设计分层混合训练框架,结合透视与全景图像数据,提升真实感和几何一致性。它支持多任务,优于现有方法,为三维场景生成提供新思路。

量子位
产品应用8

帮大模型提速80%,华为拿出昇腾推理杀手锏FlashComm,三招搞定通算瓶颈

在大模型推理通算难题凸显的背景下,华为数学家祭出 FlashComm。它包含三项技术,分别在 AllReduce 通信、以存换传、多流并行方面优化,解决通信瓶颈,提升推理性能,未来还将围绕多方向创新。

机器之心
新闻资讯8

Qwen3.8-Max 正式版终于发布了,能不能打过 GPT 看这里

Qwen 3.8 Max 正式发布,沿用 Qwen 3.5 架构,参数量扩展,重点提升 Coding、Work 和 Agent 能力。它将开放权重,价格有优势。在多项测试中表现出色,还新增多模态能力,已可使用并有优惠。

MacTalk
算法论文8

具身智能能力狂飙,安全却严重滞后?首个安全可信EAI框架与路线图出炉!

具身人工智能发展迅速,但能力与安全出现“脱钩”。上海人工智能实验室和华东师范大学团队撰写论文,为“安全可信具身智能”建立理论框架与蓝图,提出成熟度模型、分析框架等。

机器之心
开源动态8

Emu3.5:能够原生预测下一状态的多模态世界模型,媲美Nano Banana

北京智源研究院推出多模态世界模型Emu3.5,能原生预测视觉和语言下一状态。用超10万亿token数据预训练,后经强化学习训练。团队提出DiDA提升推理效率,其性能媲美Nano Banana,项目已开源。

AI工程化
产品应用8

懂方言,通诗词,精通30国语言,阿里发布语音识别大模型Fun-ASR1.5

阿里发布语音识别大模型Fun - ASR1.5,可精准识别30种语言,覆盖中文七大方言体系及二十余种地方口音,强化古诗词诵读专项识别,后处理环节优化标点预测和文本归一化,降低人工成本。

千问大模型
产品应用7

阿里“快乐马”团队再出手!正面叫板谷歌 Genie 3,世界模型 HappyOyster 来了

4月16日,阿里发布世界模型产品HappyOyster,由ATH创新事业部团队研发。它与谷歌Genie 3同属世界模拟器流派,采用长跨度世界演化建模,有漫游和导演两大核心能力,在多方面呈现差异化优势。

AI前线
开源动态8

谷歌开源Gemma 3n:2G内存就能跑,100亿参数内最强多模态模型

本周五凌晨,谷歌正式发布、开源全新端侧多模态大模型 Gemma 3n。它有多模态设计、专为设备端优化等特性,核心是 MatFormer 架构,还采用了 PLE 技术等,在多方面实现质量提升

机器之心
产品应用8

只用国产GPU训练的大模型性能飙升100%!国内唯一,更懂你

科大讯飞发布全国产算力训练的讯飞星火X1.5,推理效率暴涨100%,综合性能跻身全球顶级。还首发非自回归语音大模型架构,效果提升、成本降低。此外,展示多领域应用成果,发布相关产品,开源智能体平台。

新智元
产品应用8

可灵2.5Turbo实测|顶尖AI视频模型,真能打平CG吗?

可灵发布2.5 Turbo版本视频模型,进步显著,提示词理解、高速动态表现、风格稳定性都有提升,价格还更划算。经多场景测试,其在特定场景下内容质量能与CG媲美,开始理解动作背后逻辑。

歸藏的AI工具箱