「非凸优化」共找到 1825 篇相关文章
函数向量对齐技术,让大模型持续学习不“失忆”丨ICLR 2025
中国科学技术大学等校团队破解大语言模型灾难性遗忘之谜,发现遗忘源于模型激活带偏差新功能,非覆盖旧功能。还设计FVG训练法,保留并对齐函数向量,保护模型能力。相关论文被ICLR2025接收,代码开源。
狂涨 36.9K star!!看看人家的开源微信机器人多优雅,微信、飞书、钉钉支持,效率飙升!
开源君介绍超火的开源项目`chatgpt-on-wechat`(CoW),它结合大模型与社交、办公平台,可定制优化。能接入多平台,支持多模型,处理多模态消息,有丰富插件,还能记忆会话、定制知识库。给出安装步骤。
ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键
ICML 2025新研究揭示,在使用RoPE的现代Transformer模型里,注意力机制Q和K表示有集中极大值,V表示无此模式。研究通过实验明确极大值与上下文知识理解的联系,对模型设计、优化和量化有重要启示。
PDL 在 SGLang Kimi K3 中的应用
文章介绍 PDL 在 SGLang Kimi K3 中的应用,K3 内核优化接入 PDL 以缩短相邻内核间隙。分析 PDL 原理、在 bs=1 decode 中解决的问题,阐述计算链和通信链上的应用,还提及性能数据和实现问题。
时间会证明光的
市场曾质疑AI资本开支高增长的持续性,如今随着头部模型公司ARR非线性爆发式增长,AI商业正向循环打通。在AI硬件产业链中,光互联是国内厂商全球参与度最高、份额最稳固的环节,正迎来最好时代。
人形机器人设计正在向仿真器低头!40年机器人从业老兵发出警告
人形机器人行业现怪象,为让仿真系统和强化学习更顺,一些有机械优势的结构因‘仿真麻烦’被排除。40多年经验的Scott Walter质疑设计变得‘S.T.U.P.P.I.D.’,指出仿真应服务设计而非主宰。
Opus 4.5之后,AI正在催生“巨头型百人公司”
Opus 4.5发布后,Agent赛道洗牌,模型差距由Agent Loop拉开。本文围绕Cherry Studio,与创始人及投资人探讨AI公司护城河、开源意义、用户价值差异等,指出未来将催生“巨头型百人公司”。
Anthropic最新论文:检测LLM内省意识的方法
Anthropic与MIT等研究表明,LLM能‘感知’被注入的steering vector,‘内省意识’在DPO等后训练阶段涌现。研究构建实验,发现内省能力行为稳健、检测非简单线性关联等,还揭示检测与识别机制不同及两阶段电路。
Tank OS:红帽首席工程师把OpenClaw打包成可启动的Linux设备
红帽首席软件工程师Sally O'Malley在GitHub发布开源工具Tank OS,它用bootc技术将Fedora Linux和OpenClaw打包成可启动容器镜像。该工具解决OpenClaw配置安全问题,适合企业环境,虽非面向小白,但对企业IT重要。
马斯克脑机接口团队成员出走,他们想把“清醒梦”变成消费电子产品
Prophetic AI是一家致力于研发非侵入式头带以诱导清醒梦的初创公司。其核心设备The Halo通过经颅超声刺激实现神经调节,还发布了大模型Morpheus - 1诱导并稳定清醒梦,但此方法论引发了诸多争议。