豆包大模型1.6」共找到 8682 篇相关文章

算法论文8

ICLR 2026 Oral|大模型总爱「想太多」? DECS从源头消除冗余思考,实现推理token减半且性能不降反升

以DeepSeek - R1等为代表的大型推理模型存在过度思考问题,造成大量冗余计算。复旦大学等团队在ICLR 2026 Oral论文中揭示‘长度惩罚’局限性,提出DECS框架,在多基准测试中实现推理长度减半且性能提升。

机器之心
8

库克清空弹夹!2nm,韬定律,最强AI电脑

库克退休前火力全开,苹果发布首款2nm制程芯片M6和最强M系芯片M5 Ultra,塞进新款Mac。M6让Mac mini AI性能暴涨,M5 Ultra性能强悍,能跑大模型。但因内存短缺,高内存版限购且供货晚,价格也涨了。

量子位
8

382人、平均95后,MiniMax百亿估值冲刺IPO!招股书首次披露业绩:研发成本仅为OpenAI的1%、收入猛增8倍

12月21日,MiniMax通过港交所上市聆讯。该公司员工年轻,创始人背景强。其发布多模型,产品覆盖多场景。研发成本仅OpenAI的1%,营收增长快,付费用户多,上市或促进行业转向“经营叙事”。

InfoQ
新闻资讯7

一个提示攻破所有模型,OpenAI谷歌无一幸免!

HiddenLayer研究发现一种「策略傀儡」提示,将危险指令伪装成配置片段,配上角色扮演,能让ChatGPT等主流大模型开启「无限制模式」。此策略利用训练弱点,难修复且可扩展,厂商需智能监控。

新智元
新闻资讯7

DeepSeek-R2要来了?

DeepSeek-R1发布一周年之际,其存储库更新引用全新「model 1」模型,极可能是R2。HuggingFace发文称R1降低技术、采用、心理三重壁垒。R1以推理优先,改变多项认知,故事仍在继续。

新智元
新闻资讯8

码农只剩6个月?Anthropic CEO断言AI接管一切代码,爆冲诺奖级智能!

达沃斯论坛上,Anthropic的Dario Amodei和谷歌DeepMind的Demis Hassabis就AGI未来展开对话。Dario预测AI 6 - 12个月接管软件工程师工作,2026 - 2027年模型达“诺奖级”;Demis认为2030年前有50%概率实现AGI。

新智元
开源动态8

一文看懂 TritonNext 2026:FlagOS 亮点详解、语言扩展新趋势、AI 生成更加“底层”、芯片软件生态或迎“新拐点”!

1月9日,「2026 TritonNext技术大会」召开,专家探讨AI编译器等最新解法。如林咏华介绍FlagOS v1.6应对生态难题;崔慧敏用“AI for Compiler”破芯片演进难题;上海人工智能实验室推出DLCompiler打破算子开发困境等。

AI科技大本营
开源动态8

Mistral 3发布,14B多模态小模型表现优异

Mistral AI第三代模型发布,含三个小型密集模型和稀疏混合专家模型Mistral Large 3,全用Apache 2.0许可。有多项技术亮点,Ollama等支持部署微调,还给出实用配置建议。

AI工程化
开源动态7

Rex-Omni:用 3B 模型颠覆目标检测

长期目标检测依赖传统坐标回归模型,MLLMs方法存在不足。IDEA研究院提出30亿参数的Rex - Omni多模态大模型,在零样本测试中表现超现有回归模型,还具备丰富语言理解能力,有独特设计和训练流程。

带你学AI
开源动态8

Qwen3家族训练秘籍公开:思考/非思考融进一个模型,大模型蒸馏带动小模型

Qwen3技术报告揭晓8款模型关键技术,采用双模式架构,训练和微调分段进行,还“大带小”蒸馏数据。其融合思考与非思考模式,训练分多阶段,Qwen Chat还全量上线深度研究功能。

量子位