「结构化生成」共找到 3021 篇相关文章
deepseek-V4算法工程技术深入浅出
文章围绕deepseek V4技术报告展开,指出当前大模型训练不充分,介绍了算法层面如混合注意力机制、模型结构优化、优化器等,工程层面如细粒度专家并行、算子内核开发等,以及后训练的范式转变和领域专家网络蒸馏等内容。
名师一定出高徒?清华团队最新揭秘:别再迷信大模型蒸馏的「免费午餐」
当下大模型后训练中,On-Policy Distillation(OPD)成明星技术,业界采用后报告性能提升。但清华团队研究发现,换更强Teacher,Student性能可能无提升甚至倒退。研究揭示蒸馏成败条件,深挖对齐机制,还给出拯救失败蒸馏的方法。
ICML 2026 | 将多教师冲突转化为动态约束,破解多模态大模型推理对齐难题
在多模态大模型发展中,多教师知识蒸馏成提升性能关键,但教师模型存在“概念漂移”问题。悉尼科技大学团队提出 APO 框架,将模型间“漂移”转化为动态负约束,解决多模态大模型多师蒸馏概念对齐难题,工作被 ICML 2026 接收。
2026北影节首创·郎园Station主会场:1个重磅发布,1场AI超创聚会,3个AI主题展!
本周五(4月17日)起,朝阳东坝·首创郎园Station将成北影节核心主会场。期间,北京AIGC视听产业创新中心将呈现“1个重磅发布+1场AI超创聚会+3个AI主题展”,全方位展现朝阳AIGC视听产业全域创新。
9.7K Star 把 AI 编码的 token 消耗砍了 16 倍
当前AI编码工具默认读取整个项目文件,token消耗高。code-review-graph项目用Tree-sitter解析代码库成图,追踪改动“爆炸半径”,平均省8.2倍token,技术轻量,还能做社区检测。它揭示AI编码瓶颈在信息输入质量。
陶哲轩:AI 已经把想法成本降到几乎为0了...
著名数学家陶哲轩在与播客主持人Dwarkesh Patel的对谈中分享使用AI一年后的观点,认为AI已将想法生成成本降至几乎为零,但验证和评估成新瓶颈,还探讨其对数学研究的影响及未来发展。
机器人浓度最高的一届春晚后,具身智能离走进千家万户还有多远?
InfoQ《极客有约》X QCon 直播栏目邀请专家探讨具身智能落地卡点。专家认为其虽面临模型泛化、数据采集等难题,但发展乐观。工业场景对通用性需求不大,Agent 架构或成关键,数据和物理交互等方面也有挑战。
AI 推理精细化流量治理实战:RocketMQ LiteTopic 的“千人千面”流控方案
随着大模型推理服务成主流,传统消息队列限流机制在AI推理场景面临挑战。Apache RocketMQ 5.x推出LiteTopic,其精细化流量治理方案能实现‘千人千面’,解决队列头部阻塞和并发效率受损问题,还与阿里云百炼网关合作。
组织也能fork?Karpathy提出"代码即公司"
Karpathy提出“代码即公司”观点,认为AI驱动的组织可像代码仓库一样被复制、修改、迭代。传统组织因“制度性知识”难以fork,AI能将隐性知识显性化。交易公司或成首个被fork的组织类型,管理协调是核心竞争力。
GPT-4o,确认死亡
太平洋时间13号早上10点,OpenAI正式下架GPT-4o等旧模型。GPT-4o因吉卜力风爆火,也因“谄媚”饱受争议。网友不满,呼吁回归,因其新模型太“人机”。模型与用户建情感连接是双刃剑,AI安全与伦理成议题。