DeepSeek-R1-Distill-Qwen-1.5B」共找到 2447 篇相关文章

产品应用8

美团龙猫LongCat技术升级!新注意力机制解码速度快10倍,还能处理1M超长文本

美团龙猫LongCat系列发布全新稀疏注意力机制LoZA,重点解决长文本任务难题。它在MLA机制基础改造,计算复杂度降至线性,处理128K上下文解码快10倍,性能不缩水,后续还计划支持动态稀疏比例。

量子位
新闻资讯7

谷歌 Gemini API 负责人自曝:用竞品Claude Code 1小时复现自己团队一年成果,工程师圈炸了!

谷歌主管工程师 Jaana Dogan 称,用竞品 Claude Code 一小时就生成了接近自己团队一年成果的系统。她公开评价引发争议,也让大家思考‘一年工程 vs 一小时生成’背后被压缩的是什么。

AI前线
7

83岁用DeepSeek抢单,96岁凭AI挣养老钱!这群80+老人比你还会玩AI

文章讲述美国不少八九十岁老人积极学习AI,如Luis Bautista创办科技公司,Katherine Cavanaugh用AI接单。不过也有老人反对,担心其带来脑力退化等问题。研究称年长员工受AI影响或更大,还面临职业偏见。

新智元
新闻资讯7

北大校友孙之清C位出镜,小扎看OpenAI直播夺人!1亿刀薪酬光速被签

CoT之父Jason Wei离职后,又一华人科学家孙之清入职Meta。他曾在OpenAI与奥特曼同框直播,此前深度参与o3等项目,还带头做「ChatGPT Agent」技术实现。加上Jason Wei等,三人都加入Meta。

新智元
产品应用7

用了60天Claude Code,我的Vibe Coding终极指南:从0到1的正确打开方式

作者分享使用Claude Code 60天的经验,用多个案例展示其将AI编程从辅助推向自主的能力,还给出Vibe Coding方法论、工作流等,提醒别被工具束缚,技术为人服务。

探索AGI
新闻资讯7

图灵奖大佬向97年小孩哥汇报?小扎1亿年薪买新贵,老将痛诉熬夜捡GPU!

新智元报道,小扎砸143亿拿下Scale AI 49%股权引入Alexandr Wang任Meta首席AI官,甚至可能让LeCun向其汇报。而Meta老员工因GPU受限研究受阻,科技圈有人上亿年薪,有人被裁,AI圈呈职业体育趋势。

新智元
开源动态8

字节跳动开源文档解析大模型Dolphin,告别繁琐的文档处理,上线狂揽1k星,真是绝了!

字节跳动开源文档解析大模型Dolphin,采用两阶段分析 - 解析范式,有异构锚点提示等功能,适用多领域。技术架构基于视觉 - 编码器 - 解码器,训练集超3000万个样本,安装推理简单,比同类更具竞争力。

小华同学ai
算法论文7

AI仅凭“自信”学会推理,浙大校友复刻DeepSeek长思维链涌现,强化学习无需外部奖励信号

UC Berkeley团队提出新训练方法Intuitor,大模型无需接触真实答案,仅优化自身信心就能学会复杂推理。该方法无需外部奖励信号或标注数据,用模型自身置信程度作内在奖励信号,在多任务表现良好。

量子位
开源动态8

2天1k多星!BAGEL横空出世:字节跳动发布全球首个多模态全能AI,开启智能新纪元!

字节跳动推出开源多模态基础模型BAGEL,有70亿活跃参数。它在多模态理解排行榜超顶尖开源模型,文本到图像质量与SD3媲美,还具备世界建模等能力,文中介绍其方法、特性及使用说明。

GitHubStore
开源动态8

完全开源的7B模型,性能比肩主流LLM,训练成本仅16万美元,复现DeepSeek的强化学习!

Moxin-7B由多机构团队联合开发,遵循“开源科学”原则,公开全流程细节。它训练成本仅16万美元,评测表现亮眼,在架构、数据策略、训练过程等方面有创新,为中小企业提供可控AI方案。

AI科技大本营