深度学习模型训练」共找到 8620 篇相关文章

推荐文章7

AI们数不清六根手指,这事没那么简单。

作者测试发现Grok4、OpenAI o3等多模态模型都将六指图数成五指,仅Claude 4偶尔答对。研究揭示大模型看图片用记忆而非视觉,易受刻板印象影响,在工业等场景或引发严重后果。

数字生命卡兹克
8

一天 15k 星,代码生成碾压 Claude,连 Cursor 都慌了?谷歌 Gemini CLI 杀疯了

谷歌发布 Gemini CLI,有慷慨免费使用配额,开源且不到一天获 15.1k 星。它连接 MCP 服务器,具备 Agentic AI 能力,接入 Gemini 2.5 Pro 模型,在代码生成等方面表现出色,谷歌认为通用模型更优。

AI前线
算法论文7

DeepSeek们越来越聪明,却也越来越不听话了。

论文《When Thinking Fails: The Pitfalls of Reasoning for Instruction - Following in LLMs》用实验验证,模型推理能力变强时,提示词遵循能力变差。研究团队对15个模型测试,发现用CoT推理后执行准确率下降,还提出4种提升指令遵循效果的方案。

数字生命卡兹克
产品应用8

抛弃“级联”架构!快手OneRec用大模型重构推荐系统,服务成本降至1/10

传统级联式推荐架构有瓶颈,快手用OneRec重构推荐链路,服务成本降至1/10。文中介绍OneRec架构、Tokenizer方案、强化学习奖励设计,还提及优化及多模态联合训练方向。

InfoQ
产品应用8

录音笔的终结者,还是AI时代的又一个“美丽废物”?深度体验出门问问TicNote

作者体验出门问问AI硬件产品TicNote一个月,称其超薄超轻,有双模式录音功能,解决手机录音痛点。软件强大,支持多语种和方言,能自动总结,还可拓展内容。价格有两档,适合多类人群。

歸藏的AI工具箱
算法论文8

华为攻克AI推理「想太多」问题!新方法让大模型推理提速60%,准确率还高了

华为提出高效推理方法S - GRPO,突破思维链「冗余思考」瓶颈。通过“串行分组 + 衰减奖励”设计,在Qwen3上有效,推理提速60%,生成答案更精确有用,在多个推理benchmark测评中表现出色。

量子位
新闻资讯8

经纬领投2000万美元,Aether AI让机器人学会举一反三|甲子光年

6月18日,Aether AI获约2000万美元首轮融资。创始人黄碧薇认为主流大模型学的是相关性而非因果性,她将LLM和因果算法结合,打造因果世界模型,搭建“因果大脑”,并选择具身智能作为落地场景。

甲子光年
产品应用8

3B激活参数,干翻GPT-5.4和Opus4.6,商汤绝影把龙虾塞进了车里

商汤绝影发布端侧多模态大模型Sage,32B总参数、3B激活参数,在PinchBench评测超Claude Opus4.6等。自研SCOUT和ERL技术助力,从多维度领先同量级端侧模型,为座舱智能体提供支撑。

量子位
新闻资讯8

老黄All in物理AI!最新GPU性能5倍提升,还砸掉了智驾门槛

英伟达CEO黄仁勋在CES 2026发布AI新品,全力搞AI。推出下一代Rubin架构GPU,性能大幅提升;发布五大领域成果,含新模型家族、平台等;还开源训练框架与多模态数据集,国产开源模型被提及。

量子位
开源动态8

长上下文快2.9倍,解码快6倍:Kimi 用线性注意力实现性能与效率双突破

月之暗面团队的Kimi Linear模型,是混合线性注意力架构,核心是Kimi Delta Attention模块。它解决线性注意力的记忆及遗忘问题,在多任务测试表现出色,还开源相关资源,推动高效长上下文模型研究。

AIGC开放社区