DeepSeek-V4-Lite-285B」共找到 696 篇相关文章

算法论文8

英伟达笑到最后!训练2000步,1.5B逆袭7B巨兽,Scaling真来了

英伟达团队提出ProRL训练法,将强化学习扩展到超2000步。用此方法训练的15亿参数模型媲美70亿参数的Deepseek - R1 - 7B,在多任务中表现出色,解决了熵崩溃和训练不稳定问题。

新智元
产品应用8

阿里的 AI IDE 登场了,这事绝对有戏

阿里云正式发布通义灵码的AI原生IDE:Lingma IDE,免费开放,核心功能和Cursor对齐且速度更快。其整合Qwen、DeepSeek系列模型,有感知引擎等亮点,还有企业版适合国内公司。AI编程竞争激烈,阿里有机会做成。

MacTalk
产品应用7

Multi-Agent 的灵活编排之路

文章从Copilot 3.0架构规划模块出发,结合DeepSeek R1强化学习训练实践,探讨多智能体架构下大模型编排智能体解决问题。分析Copilot 2.0局限并介绍3.0升级,指出难点,展示效果对比及解决方案。

阿里云开发者
新闻资讯8

陈大年复出,入局大模型

国产大模型领域黑马StartLux-V1.0-27B-Preview,参数量仅27B,在信通院MCP测试中排综合第二,仅次于1.6万亿参数量的DeepSeek-V4-Pro。其创始人陈大年押注本地模型,公司专注该领域商业化。

量子位
8

刚刚,国产Agent模型闯入全球第一梯队!限时免费

昆仑万维发布SkyClaw-v1.0及其轻量版SkyClaw-v1.0-lite Agent模型,性能达全球第一梯队,价格仅主流顶尖模型一半甚至更低,适配主流Agent框架,还兼容OpenAI接口,现限时免费,后续将逐步开源。

量子位
算法论文8

ICLR 2026 Oral|大模型总爱「想太多」? DECS从源头消除冗余思考,实现推理token减半且性能不降反升

DeepSeek - R1等为代表的大型推理模型存在过度思考问题,造成大量冗余计算。复旦大学等团队在ICLR 2026 Oral论文中揭示‘长度惩罚’局限性,提出DECS框架,在多基准测试中实现推理长度减半且性能提升。

机器之心
算法论文8

LSTM之父Jürgen再突破,「赫胥黎-哥德尔机」让AI学会自己进化

LSTM 之父 Jürgen Schmidhuber 对 2003 年提出的哥德尔模型进行新尝试,构建赫胥黎 - 哥德尔机(HGM)。它能在 SWE - Bench Lite 媲美最佳人类设计智能体,还在多基准测试中超越现有方法,展现强大迁移能力。

机器之心
开源动态8

刚刚,小红书开源了首个多模态大模型dots.vlm1,性能直追SOTA!

小红书人文智能实验室(hi lab)低调开源视觉语言模型dots.vlm1。该模型基于自研视觉编码器构建,在视觉理解和推理任务上接近SOTA水平,实测表现惊艳,还介绍了其技术架构、预训练数据布局等内容。

新智元
新闻资讯8

黄仁勋中国现场直击!假如有一个「数字黄仁勋」,我希望我们一起变聪明

英伟达CEO黄仁勋再访北京,接受新智元等媒体采访。他盛赞华为优秀,评价DeepSeek等模型出色,还谈及AGI、数字分身、出口管制等话题。此外,H20芯片解禁重售释放政策信号,有望实现中美科技企业合作共赢。

新智元
开源动态8

杨植麟被梁文锋叫醒了!Kimi新模型发布即开源,1T参数全线SOTA

172天后,Kimi推出全新Kimi K2基础大模型回应DeepSeek冲击。它为MoE架构,1T参数,激活参数32B,在多任务上领先,发布即开源,还分享技术细节,实测有亮点也待优化,展现回归之势。

量子位