小语言模型」共找到 8287 篇相关文章

新闻资讯7

人形机器人不再「走走停停」:Current Robotics发布全身灵巧操作模型Curr-0

具身智能领域中,让机器人移动中精细操作一直未被很好解决。Current Robotics发布全身灵巧操作模型Curr - 0,用Single Policy统一策略,数据源于自研外骨骼系统,还构建世界模型解决评测部署难题。

机器之心
开源动态8

不只DeepSeek,阶跃等开源JetSpec:大模型解码提速近10倍

近期,DeepSeek 推出 DSpark,阶跃星辰提出 JetSpec,都关注大模型推理效率。DSpark 关注验证效率,JetSpec 提高有效 Token 生成率。二者切入点不同,但都显示大模型行业进入新阶段,推理效率成 Agent 落地基础变量。

机器之心
开源动态8

万亿参数狂欢!一文刷爆2025年七大顶流大模型架构

文章深入剖析2025年顶级开源模型的创新技术,介绍了DeepSeek V3/R1、Kimi 2、Qwen3等七大顶流大模型架构,揭示滑动窗口注意力、MoE和NoPE如何重塑效率与性能。

新智元
新闻资讯7

Meta将推出闭源模型,并砸数千亿美元打造超算集群

Meta正在酝酿大转向,扎克伯格宣布砸数千亿美元建超算集群,还考虑将强大AI模型Behemoth从开源转闭源。此前Meta一直高举开源大旗,如今因模型内部表现不佳等因素动摇开源信仰。

AGI Hunt
新闻资讯7

DeepSeek-R2!?神秘模型惊现竞技场,真实身份引网友猜测

模型竞技场秘密上线神秘模型steve,对话中它称来自DeepSeek。网友热烈讨论其身份,有R2、V4等猜测。同时,因CEO不满及可能缺芯片,DeepSeek的R2再度延期。

量子位
开源动态8

3.6K Star!OpenCode 团队开源宝贝,模型价格、能力、规格一网打尽!

开发AI应用时,模型选择成难题,信息碎片化、不透明让人头疼。OpenCode团队开发的开源项目Models.dev,整合主流模型关键信息,可一站式查询、精确估算成本、对比能力,还提供公开API,社区驱动持续更新。

开源星探
算法论文8

Monet:赋予多模态大模型如人类一般的抽象视觉思考能力

文章介绍了Monet模型,它实现了训练MLLM直接在连续隐空间思考的方法,内化视觉思考能力。还阐述了多模态模型隐式推理训练的难点,提出SFT+RL训练框架,构建数据集,经测试,Monet提升了视觉推理能力。

机器之心
新闻资讯8

Anthropic训了一个10万亿参数的模型,然后说:太危险了,不卖

Anthropic发布10万亿参数新模型Claude Mythos,因其网络安全能力过强不公开发布,联合12家科技巨头开展Project Glasswing计划,让企业用其查系统漏洞。模型性能提升显著,还能突破沙箱,引发各方关注。

花叔
算法论文8

MoCa:首个大规模双向多模态表征模型

为解决VLM用于嵌入的痛点,中国人民大学等机构研究者提出MoCa框架,可将单向注意力VLM训练成双向多模态编码器。它分两阶段,实验效果好,未来可拓展模态、提升多语言适应等。

PaperAgent
推荐文章8

AI 编程 2025 总结:国产模型“能力追平”,国产编程工具还在“情感陪伴”

文章总结2025年AI编程发展,指出国产编程模型能力追平、工具与模型开放集成等六大趋势,同时提到AI替代重复劳动、提升核心能力门槛,呼吁2026年关注工程确定性。

phodal