「深度学习模型训练」共找到 8620 篇相关文章
ACL'25首届博士论文奖 | 重新思考 LLM 中的数据使用
近日,第一届 ACL 计算语言学博士论文奖获得者是 Sewon Min,其论文《重新思考大型语言模型中的数据使用》围绕大型语言模型如何使用训练所用的庞大文本语料库展开研究。
ACL 2026 | 别轻易给AI发「~」,它可能会删掉你的整个主目录
西安交通大学等校团队揭示大模型表情符号语义混淆安全漏洞,用自动化框架测试主流大模型,平均混淆率38.6%,多数混淆响应会“静默失败”,超半数达高危害级别。
Jina-VLM:可在笔记本上跑的多语言视觉小模型
Jina AI 发布 2.4B 参数量的视觉语言模型 Jina-VLM,在多语言视觉问答任务达 SOTA。它引入注意力池化,连接视觉与语言基座,支持 29 种语言,能高效处理问答等任务,对硬件需求低。
思维链可无限延伸了,MIT等打破大模型上下文天花板
MIT等机构提出新架构Thread Inference Model(TIM),配合专用推理引擎TIMRUN,把推理过程变为树状递归子任务结构并修剪子任务,让模型突破输出窗口限制实现长程推理,实验验证了其性能。
智源发布 2026 十大 AI 技术趋势:世界模型成 AGI 共识方向
2026年1月8日,智源研究院发布《2026十大AI技术趋势》,指出AI演进核心从语言学习转向理解物理世界秩序。报告阐述了AI从数字迈向物理世界的三条驱动主线,并给出十大趋势,为行业提供布局锚点。
最详细的 DeepAgents 实战拆解:一次看懂LangChain全新深度智能体框架
本文深入解读了LangChain推出的全新开源项目DeepAgents。它定位为“深度Agent”框架,能提升复杂场景下Agent能力。文中通过股票分析实例展示其任务规划、文件系统、子智能体三大核心机制,还介绍原理与未来发展方向。
开源仅一周,鹅厂文生图大模型强势登顶,击败谷歌Nano-Banana
腾讯混元团队开源的原生多模态生图模型混元图像 3.0,开源仅一周就在国际权威评测榜单 LMArena 上超越谷歌 Nano - Banana 等,位列文生图综合和开源榜单第一。实测表现出色,技术上也有诸多创新。
Thinking Machines发布首个产品Tinker :大模型后训练彻底变天
OpenAI前CTO Mira Murati的Thinking Machines公司发布首个产品Tinker,这是为微调大模型设计的灵活API,能简化LLM后训练过程,让用户专注算法和数据,平台处理分布式训练。它有多种特性,已被顶尖机构采用。
用最简单的大模型技术打造一个迁云专家有多难?
文章探讨在云迁移领域用大模型技术“复制”专家80%核心能力。分析标准化方案不足及简单RAG局限,介绍“LX0.1”AI专家助手构建,还提及分层评测、人机协同等优化,最后展望AI在云迁移的未来方向。
复盘 ChatGPT:7 亿周活的 ToC 产品,如何在模型之外做增长?
Lenny播客邀请OpenAI的ChatGPT负责人Nick Turley对谈,他分享了ChatGPT从内部项目成长为7亿周活产品的过程,包括产品开发、增长、定价决策等,还阐述了成功原因、增长方法等,为AI创业者带来启发。