开源大模型」共找到 10086 篇相关文章

开源动态8

代码检索新王登基!CodeFuse | 开源C2LLM,用“注意力池化”刷新MTEB-Code榜单

蚂蚁集团与上海交通学推出C2LLM系列模型,基于注意力创新池化机制解决代码表征痛点,登顶MTEB - Code榜单。作为CodeFuse Embedding开源家族成员,将全套回馈社区,为代码模型研发提供基线。

AINLPer
开源动态7

FLUX.2开源了,但是我好像也看到了小公司的无力。

AI绘图曾经的王者FLUX.2部分模型开源,包括dev和即将开源的klein。但与Nano Banana Pro对比,其生图、改图及世界知识表现欠佳。这凸显小厂在厂资源碾压下的无力,但开源仍有价值。

数字生命卡兹克
算法论文8

模型听懂语音却反而变笨?港中深与微软联合解决语音模型降智问题

从GPT - 4o开启全能交互时代后,Speech LLM面临“模态推理鸿沟”问题,输入从文本变语音,推理能力显著衰退。港中深与微软联合提出TARS框架,通过三项创新解决此问题,实验显示推理能力100%复原。

机器之心
开源动态8

告别昂贵人工标注,英伟达全自动视频理解助力小模型逆袭顶级模型

麻省理工、英伟达等推出FoundationMotion,它是全自动数据生成流水线,能解决运动数据稀缺难题。通过自动标注生成问答数据,让小模型经微调后在运动理解上超越顶尖闭源模型,还介绍了其数据生成、问答设计等环节。

AIGC开放社区
开源动态8

真实评估!北理发布全球首个「全场景教育」基准,支持4000+情境

北京理工学高扬老师团队推出EduBench,是全球首个「全场景教育」基准,涵盖9教育场景、12个评估维度、超4000个情境。团队将数据、模型等全面开源,评估发现模型在特殊教育场景有不足,还提出多源知识蒸馏等方法。

新智元
算法论文7

穷人福音!MIT研究:不用堆显卡,抄顶级模型作业就成

MIT研究把59个不同模型凑一起,发现强模型对物质理解趋同,且性能越强思维越接近。研究还指出性能不佳模型的问题,认为可通过模型蒸馏让小模型模仿模型,实现算力自由。

新智元
算法论文8

DeepSeek点燃模型效率之争,阶跃火速接棒:JetSpec让模型解码速度最高提升近10倍

近期,DeepSeek发布DSpark,阶跃星辰发表JetSpec论文,二者聚焦模型推理效率。DSpark关注验证效率,JetSpec从Draft生成本身入手。结果显示,二者都有加速效果,共同表明推理效率正成Agent落地关键变量。

量子位
新闻资讯8

国产模型「五强争霸」,决战AGI!

中国基础模型市场形成「基模五强」格局,包括字节、阿里、阶跃星辰、智谱和DeepSeek。它们要么有钱,要么有人,各有特色与优势。未来竞争焦点是追求更高「智能上限」和突破「多模态能力」,决战AGI。

新智元
算法论文8

清华唐杰团队揭示模型记忆全景

清华唐杰教授团队等发布模型记忆架构综述,提出三维记忆分类学,将前沿工作统一到理论框架,为LLM设计指明方向,分析了隐式、显式记忆架构,还探讨混合架构挑战与未来方向。

量子位
开源动态8

DeepSeek开源的文件系统,是如何提升模型效率的?

2月28日,DeepSeek开源高性能分布式文件系统3FS以解决人工智能训练和推理挑战。介绍了分布式文件系统优势,深入解读3FS的组件、CRAQ协议等,还探讨其与其他系统差异及性能相关问题。

机器之心