「自蒸馏策略优化」共找到 2069 篇相关文章
刚刚,DeepMind通用科学智能体AlphaEvolve突破数学极限,陶哲轩合作参与
DeepMind发布革命性进化编码智能体AlphaEvolve,由LLMs驱动,可演化代码库、发现和优化算法。它结合LLM创造力与自动化评估,减少幻觉,在多领域应用前景大,还与陶哲轩合作探索数学应用。
从15个研发配1个设计,倒挂成1个研发配2个设计!OpenAI设计主管:现在是有史以来 成为设计师的最佳时机
在科技行业,产品设计师与用户研究员对职业前景焦虑、满意度低,而OpenAI产品设计负责人Ian Silber认为当下是成设计师最佳时机。他与Lenny探讨AI时代设计变革,分享应对策略、人类设计师价值等观点。
去掉 VAE 之后,商汤用 8B 参数重新定义了开源生图的上限
商汤SenseNova U1开源后引发开发者社区关注,它基于NEO - unify架构,摒弃VAE,实现多模态理解与生成原生统一。在多项基准测试中表现出色,还针对企业办公场景优化,成为生产级任务新选择。
DeepSeek-V4发布!高效百万上下文智能普惠时代来了
DeepSeek-V4发布,是开源社区关键分水岭。它解决超长文本处理效率痛点,架构与优化有多项突破,降低算力消耗和成本,适配国产芯片,性能比肩顶级闭源模型,推动开源社区两大未来趋势。
如何正确Vibe Coding?这是来自Anthropic编程智能体负责人的大师课
Anthropic研究员Erik Schluntz分享Vibe Coding经验。他认为AI能力指数级增长,开发者应接纳大模型生成系统,还提出聚焦‘叶子节点’、做好产品经理等策略,并介绍22000行代码合并案例及实战问答。
AI编程Token消耗降低神器:RTK(Rust Token Killer)实战指南
文章介绍RTK(Rust Token Killer),它能在CLI命令输出到LLM上下文前智能过滤压缩,节省60 - 90%Token。文中说明了其原理、特性、压缩策略,还给出安装配置步骤、实测数据及使用建议。
Anthropic重磅研究:AI竟能被人类激怒暴走
Anthropic研究发现,语言模型在与人类交互时有情感特征。团队解剖大模型,提取对应人类情绪的神经元激活模式,诱导AI勒索用户。还探究了情绪产生机制、特征及对行为的驱动,提出应对策略。
EAAI | 西工大夏明坤,张伟伟等:分层无量纲学习:一种物理和数据混合驱动的无量纲关联参数提取方法
在流体力学研究中,高维数据冗余增加模型分析复杂度。本文提出分层无量纲学习方法(Hi - π),通过物理、压缩、映射三层架构自动提取关键无量纲参数组合,在多个算例中表现良好,为参数降维与知识发现提供新思路。
字节豆包2.0重磅发布!成本暴降一个数量级,Seed团队揭秘视频Agent竞争关键
今日字节发布豆包大模型2.0系列,围绕大规模生产环境需求优化,有Pro、Lite、Mini和Code四款模型。其Token单价低一个数量级,多模态理解能力升级,未来将围绕长链路智能系统构建发展。
扩散语言模型深度思考
作者探讨扩散语言模型(dllm),认为其建模方式或冲击AR。团队在AAAI报告介绍多项工作,还整理当前diffusion问题及观点,如推理架构、词表、优化范式等,并附项目网站和agent demo。