「可微分联合优化」共找到 2232 篇相关文章
图像编辑太慢太粗糙?全新开源自回归模型实现精准秒级修改 | 智象未来
AI图像编辑中扩散模型有两大难题,智象未来团队提出全新自回归图像编辑框架VAREdit,引入视觉自回归架构,提升编辑精准度与速度。模型和代码已开源,还提出SAR模块优化,在基准测试表现出色。
专门收购和孵化无聊产品,年收入 3 亿美金的 Tiny 给了些启发
Tiny 通过收购孵化不起眼但赚钱的产品,成年收入 3 亿美金的控股公司。联合创始人 Andrew Wilkinson 分享创业见解,如选有利润空间的细分市场,初期选能快速获正反馈的生意,还谈到收购、管理等多方面经验。
Nature Machine Intelligence颠覆有机化学研究范式,上海交大发表化学合成大语言模型
上交大AI4S团队依托平台,联合多团队在AI for Chemistry领域获突破。相关研究发表于《Nature Machine Intelligence》,介绍白玉兰化学合成大模型Chemma,它加速有机合成全流程,在多任务表现出色,还能解决数据稀疏等问题。
Cache Me If You Can:陈丹琦团队如何「抓住」关键缓存,解放LLM内存?
普林斯顿大学陈丹琦团队新论文聚焦长上下文语言模型 KV 缓存问题。传统 KV 缓存大小随输入文本长度线性增长,此前方法难公平比较。团队提出「KV 足迹」指标,改进方法并推出 PruLong 优化内存,节省空间且保性能。
Claude悄悄更新了Skills生成器,这绝对是一次史诗级升级。
Anthropic的Claude悄悄更新了Skills生成器Skill - creator,此次是史诗级升级,新增评估系统、基准测试、多代理并行测试、描述调优等4个全新能力,还演示了其使用方法和效果,建议更新并优化评估所有Skills。
谷歌黑魔法,没人能看懂的Gemini 3 Flash
Gemini 3 Flash速度快3倍且智力超Pro,但没人明白其更「聪明」的原因。它打破「参数即正义」逻辑,在多项测试领先。谷歌或靠TPU、算法、数据优化,还可能用了Titans架构,有重大战略意义。
蚂蚁专用模型超越o3!仅用2K训练样本刷新医疗AI榜单纪录
蚂蚁集团联合团队发布《MedResearcher-R1: Expert-Level Medical Deep Researcher》报告,其医学AI智能体MedResearcher-R1用2100条训练样本在医疗基准测试反超通用大模型,靠数据、工具、训练方法三大创新实现突破。
X-SAM:从「分割一切」到「任意分割」:统一图像分割多模态大模型,在20+个图像分割数据集上均达SoTA
中山大学、鹏城实验室、美团联合提出X - SAM,统一图像分割多模态大模型。它将分割范式扩展,设计通用输入输出,采用端到端架构和三阶段训练策略,在超20个数据集达最优,为图像分割研究开辟新方向。
还得是华为!Pangu Ultra MoE架构:不用GPU,你也可以这样训练准万亿MoE大模型
华为盘古团队发布Pangu Ultra MoE模型架构与训练方法的中文技术报告。该模型全流程在昇腾NPU上训练,团队在架构和训练方法创新,实现准万亿MoE模型训练,还在多方面优化提升性能。
解码加速15倍!EdgeRazor助推大模型在PC/移动端“狂飙”
大语言模型参数膨胀,端侧部署难,量化成主流轻量化方案。开源工具库EdgeRazor由南京大学和微软联合推出,采用MPQAD打破极低比特大语言模型“能力塌陷”,在性能、效率、易用性等方面表现出色,打通AI全生态链路。