「低秩参数修剪」共找到 1605 篇相关文章
腾讯混元开源 4 个小尺寸模型,主打 Agent 和长文
8月4日腾讯混元开源四款小尺寸模型,参数为0.5B、1.8B、4B、7B,消费级显卡可运行。模型推理快、性价比高,在多领域表现出色,亮点是Agent和长文能力,已在腾讯多业务应用。
当微信支付开放MCP之后,我却有一点后怕。
微信开放微信支付MCP,补上智能体链路支付短板,使用门槛低。作者分享体验,做了多个案例,如一周健康餐智能体。但全量开放或带来风险,如AI自主完成灰产闭环、AI骗AI钱等。
Suno最强开源对手来了!ACE Studio和阶跃星辰联合开源了一款音乐模型,20秒即可生成4分钟神曲!
ACE Studio和阶跃星辰联合开源音乐模型ACE - Step,参数量3.5B,结合多种技术,支持多语言多风格音乐生成。20秒可生成4分钟歌曲,比传统模型快15倍,有多种功能亮点,还介绍了上手步骤和应用场景。
顶模 Fable 5.1发布,到底强了多少?
昨晚,Anthropic发布Fable 5.1和Mythos 5.1,这代沿用Fable 5参数,性能提升聚焦长任务,还降低缓存读取价。它在游戏、视频等多个领域表现出色,与同类模型对比进步明显,虽价格贵,但能力、速度有提升。
Qwen3.8-Max首发上线阿里千问AI平台,API服务与Token Plan同步开放
今日,阿里巴巴发布新一代基座大模型Qwen3.8,千问AI平台首发其Max版API服务与Token Plan。Qwen3.8参数量2.4万亿,性能居前列,推理快且能自主编程。API性价比高,平台还为Token Plan用户提供优惠。
Cursor改变了写代码的方式,云电脑改变了跑Cursor的方式
AI编程已成核心生产力,但Cursor等工具对硬件要求高,运行卡顿。问题不在电脑配置低,而在于AI工具不应挤在常用电脑里。无影云电脑作为‘第二桌面’,能让AI在云端运行,与第一桌面互不干扰。
实测!DeepSeek V4-pro是第一个接近Claude开源模型,前Meta研究员震惊
DAIR.AI创始人、前Meta AI研究员Elvis用DeepSeek - V4 - Pro在Pi框架搭LLM知识库,该模型开箱即用,完成知识密集型多步研究任务表现出色,在开源模型里Agent编程和推理能力强,架构设计让推理快且成本低。
PRSA 2025 | RPI Nithin Somasekharan、Shaowu Pan(潘韶武):突破柯尔莫哥洛夫屏障——面向模型降阶的可学习加权混合自编码器
本文将线性POD与非线性Autoencoder通过可学习参数融合,提出可学习加权混合自编码器架构。在多数据集验证中,该方法克服了POD和纯AE的局限,在复杂PDE系统预测中表现出色,或可降低大规模计算成本。
通义实验室正式开源 Mobile-Agent v3.5 及新一代多平台 GUI Agent 基座模型 GUI-Owl-1.5
通义实验室正式开源 Mobile - Agent v3.5 及新一代多平台 GUI Agent 基座模型 GUI - Owl - 1.5。该模型有多档参数可选,分 Instruct 和 Thinking 版,支持多平台。它解决了高质量数据难搞定等痛点,评测表现良好。
豆包 Seed 2.0 来了:字节模型跨越鸿沟
春节前字节发布豆包大模型 2.0,其在 Text 领域进入榜单前十,视觉能力全球第四且成本低。它定位多模态 Agent 模型,有多种能力升级,文中用多个案例展示其强大,还强调字节重原生能力非简单蒸馏。