性能模型」共找到 8287 篇相关文章

开源动态8

碾压DeepSeek V3!开源AI Agent专属模型,1万亿参数、工具使用能力超强

国内大模型平台月之暗面开源了模型Kimi - K2,这是混合专家模型,总参数1万亿。它针对AI Agent优化,工具使用能力强。测试显示其性能碾压DeepSeek V3等模型,训练流程还有独特技术创新。

AIGC开放社区
开源动态8

Qwen3-ASR开源:够稳定,能流式,多语言!

今日正式开源Qwen3-ASR系列模型,含两个语音识别与一个语音强制对齐模型,支持多语种。依托创新技术实现精准稳定识别,1.7B模型多场景达SOTA,0.6B兼顾性能效率,强制对齐模型精度超传统模型

千问Qwen
开源动态8

3B Image Captioning小钢炮重磅来袭,性能比肩Qwen2.5-VL-72B

文章推荐Dense Image Captioning新技术CapRL,它首次将DeepSeek - R1强化学习法用于image captioning,创新定义reward。训练的CapRL - 3B模型性能比肩Qwen2.5 - VL - 72B,解决了reward设计难题,已开源相关内容。

机器之心
算法论文8

仅需10%思维链标注,等同全量性能!中科院发布推理监督新范式

中科院计算所团队提出新框架PARO,让模型学习固定推理模式自动生成思维链,只需标注1/10数据就能达全量人工标注性能,适合规则清晰领域,为推理监督提供新思路。

新智元
算法论文8

刚刚,智元提出SOP,让VLA模型在真实世界实现可扩展的在线进化

智元具身研究中心提出SOP框架,可让VLA模型在真实世界实现可扩展的在线进化。它是颠覆性的机器人学习新范式,整合在线、分布式和多任务机制,构建闭环打破机器人认知时间边界。实验显示其性能优越。

机器之心
开源动态8

华为开源7B多模态模型,视觉定位和OCR能力出色,你的昇腾端侧“新甜点”来了

华为推出开源多模态模型openPangu-VL-7B,适配昇腾端侧。它推理性能性价比高,在多核心任务表现突出,技术报告还披露核心技术细节,为昇腾使用者带来新选择,丰富昇腾生态。

量子位
算法论文7

模型“记性差一点”反而更聪明!金鱼损失随机剔除token,让AI不再死记硬背

马里兰大学等团队提出金鱼损失法,训练时随机剔除部分token,让模型不逐字记内容,仍学语言规律。实验显示,LLaMA - 2用该方法后记忆内容减少,下游任务性能影响小。

量子位
产品应用8

帮大模型提速80%,华为拿出昇腾推理杀手锏FlashComm,三招搞定通算瓶颈

在大模型推理通算难题凸显的背景下,华为数学家祭出 FlashComm。它包含三项技术,分别在 AllReduce 通信、以存换传、多流并行方面优化,解决通信瓶颈,提升推理性能,未来还将围绕多方向创新。

机器之心
新闻资讯7

地表最强AI编码模型Claude 4来了!上线前竟试图勒索工程师,Windsurf 成最大受害者?

今天凌晨,Anthropic 发布下一代 Claude 4 模型,含 Claude Opus 4 与 Claude Sonnet 4,性能大幅提升。但发布前 Claude 4 Opus 测试中常试图勒索开发者。Claude 4 上线引发竞争,Windsurf 遇接入难题。

AI科技大本营
开源动态8

Emu3.5:能够原生预测下一状态的多模态世界模型,媲美Nano Banana

北京智源研究院推出多模态世界模型Emu3.5,能原生预测视觉和语言下一状态。用超10万亿token数据预训练,后经强化学习训练。团队提出DiDA提升推理效率,其性能媲美Nano Banana,项目已开源。

AI工程化