「DeepSeek 1.5B」共找到 4017 篇相关文章
用 Codex 读 DeepSeek 最新论文 DSpark,AI 改变了读书方式
作者用 Codex 加‘论文 Skill’读 DeepSeek 最新论文 DSpark,省一半时间还获图文并茂中文解读材料。介绍了使用方法、优势,如叠三层能力让读论文成共读之事,处理词、段及全文后可重构知识材料。
8B 端侧写作智能体 AgentCPM-Report 开源,DeepResearch 终于本地化
1月20日,8B端侧写作智能体AgentCPM - Report开源。它以端侧模型为核心,实现本地化部署与SOTA性能双重突破,亮点在于极致效能、本地安全保障,在多评测基准表现出色,部署便捷,两大创新支撑其优秀性能。
DeepSeek推理再提速80%,V4正式版定档7月中旬
DeepSeek两天前开源DSpark推理加速框架,已在V4预览版在线服务跑真实流量,使生成速度提升60% - 85%。DSpark化解推测解码问题,在多模型超Eagle3和DFlash。V4正式版7月中旬上线,将引入峰谷定价。
国产大模型新SOTA:蚂蚁万亿级旗舰模型赶超GPT-5
蚂蚁集团开源万亿参数旗舰大模型Ling-1T,属Ling 2.0家族。它激活比例低降低运算成本,训练有“Ling缩放定律”等方法,多项测试超主流模型,不过处理超长上下文成本较高。
Codex给V4-Flash装上眼睛,DeepSeek也会文档OCR
GitHub上的项目codex-vision-proxy让接进Codex的DeepSeek能看图,不用换模型或等官方,装本地代理即可。它还附带视觉工具包,在智能文档解析和OCR上潜力大,证明多模态能力可长在管道上。
LLM遇上表格:4类表示、5大任务、3大机会
文章指出LLM处理表格有任务单一、输入复杂易崩、表示不统一痛点,介绍4种表格输入表示法、5大任务,还发现任务复杂度、输入复杂度及表示统一方面存在新研究机会。
DeepSeek连发两篇论文背后,原来藏着一场学术接力
2026年1月,DeepSeek连发两篇论文,一篇解决信息稳定流动,另一篇聚焦知识高效检索。研究发现其与字节Seed团队存在“接力”,如mHC改进字节Seed的HC,Conditional Memory引用多项工作,梳理关系能助理解论文与架构创新方向。
阿里发了个简历AI神器,大小仅0.6B
阿里巴巴集团研究团队开发出基于布局感知的简历解析框架,在简历解析任务准确率逼近Claude - 4等顶尖大模型,处理仅需1 - 2秒,直击自动化简历解析痛点,已在阿里HR系统全面部署。
退钱!Claude 4.8连夜大降智,GPT-5.6算力遭「腰斩」
最近AI社区遭遇集体降智潮,OpenAI疑似暗中开启GPT - 5.6灰度测试,克扣用户思考预算;Anthropic的Claude Opus 4.8被曝断崖式降智,性能不如旧版。或因SpaceX上市抽干流动性,巨头降本增效。
3D-R1:让AI理解3D世界的下一步
文章介绍新研究3D - R1,它是更通用、具推理能力的三维视觉语言模型,解决了当前3D VLM空间理解不足与推理能力薄弱问题,在多任务测试领先,有广阔应用前景。