「DeepSeek-R2」共找到 742 篇相关文章
20人团队提前实现DeepSeek构想,AI算力变天?直击大模型算力成本痛点
国内20人玉盘AI团队推出SRDA全新计算架构方案,试图从硬件源头解决当前AI算力核心瓶颈。该架构有诸多创新设计,能应对大模型训推痛点,与DeepSeek构想契合,或成大模型专用架构分水岭。
医疗幻觉率比DeepSeek低3倍,百川循证增强大模型横扫全球医学考试!
百川智能发布首个循证增强医疗大模型Baichuan - M2 Plus,将循证医学理念融入训练和推理,首创六源循证范式。其在多场景评测中幻觉率低,多国医考成绩优异,已上线百小应APP并开放API。
爆冷!首届大模型争霸,Grok 4下出「神之一手」?DeepSeek、Kimi惨遭淘汰
谷歌Kaggle举办首届全球AI象棋争霸赛,八款顶级语言模型正面对抗。首战8进4淘汰战中,Gemini 2.5 Pro、o4 - mini、Grok 4、o3晋级,Claude 4 Opus、DeepSeek R1、Gemini 2.5 Flash和Kimi K2出局。比赛考验AI整体理解能力。
超强开源模型Qwen3、DeepSeek-V3.1,都被云计算一哥「收」了
亚马逊云科技两大AI平台支持多款新模型,Qwen3和DeepSeek-V3.1已上线Amazon Bedrock。其坚持“Choice Matters”战略,为用户提供多样选择,保障数据安全,还可基于开源模型定制开发。
腾讯与中科院联合提出R-4B,一个能自动决定是否思考的多模态大模型
多模态大语言模型“始终思考”模式有缺陷,腾讯混元团队与中科院自动化所联合提出R - 4B,通过双模式退火训练和双模式策略优化实现自动思考,在多评测中达SoTA,省资源且效果好。
阿里云通义点金发布DianJin-R1金融领域推理大模型,32B模型荣膺榜首
阿里云通义点金团队与苏州大学合作推出DianJin-R1金融领域推理大模型,介绍其开源数据集与模型、基于通义点金平台的数据合成,展示了其在性能测试中的优异表现,推动金融科技智能化进程。
a16z 全球 AI 产品 Top100:DeepSeek 增长放缓,「中国开发,出海全球」成为新常态
时隔半年,a16z发布第五版「Gen AI消费级应用Top 100」榜单,显示AI应用生态趋于稳定。Google旗下产品增长快,Grok移动端用户大增,DeepSeek增长放缓,「中国开发,出海全球」成AI应用新常态,vibe coding类应用用户粘性高。
突破显存瓶颈:基于 DeepSeek-V3.2-Exp 的 Latent Cache 卸载预取方案设计与模拟验证
百度百舸AIAK团队针对DeepSeek-V3.2-Exp,设计基于Latent Cache的卸载预取方案ESS。该方案解决显存瓶颈,提升Decode吞吐并降低成本,经模拟验证效果显著,未来将拓展应用。
任务级奖励提升App Agent思考力,淘天提出Mobile-R1,3B模型可超32B
现有Mobile/APP Agent依赖动作级奖励,难应对变化环境。淘天集团团队提出Mobile-R1框架,采用三阶段训练,结合任务级奖励,实验显示其表现超基准,团队还计划开源资源。
两周复刻DeepSeek-OCR!两人小团队还原低token高压缩核心,换完解码器更实用
两人小团队仅用两周复刻DeepSeek-OCR,复刻版DeepOCR还原其低token高压缩核心优势,还在关键任务上追上原版表现。它完全开源,无需大规模算力集群,训练方案适配中小团队。