「低秩参数修剪」共找到 1600 篇相关文章
AI产品先发优势在于用户迁移成本高,持续为用户提供价值是保持竞争优势的关键 | 对话AI智能电子衣橱工具搭搭
文章围绕AI智能电子衣橱工具搭搭展开,介绍其功能、开发逻辑与发展规划。搭搭通过AI算法筛选美图定义美,提供穿搭灵感,注重用户需求。团队投入研发,获客成本低,未来聚焦工具,解决穿搭问题,与用户共建产品。
ScienceDiscovery实现树搜索驱动RSI,加速科学发现,小时级写出通用积分器,低成本找出物理科学规律
openJiuwen社区的ScienceDiscovery把科研试错交给程序,通过树搜索实现科研场景产物RSI。它能在多个案例中高效产出成果,成本低、耗时短,且底座灵活,可换算法和任务,但推广需解决验证速度和可信度问题。
Claude Sonnet 5 上线一日差评刷屏:打不过千问和 Minimax,性价比全面翻车
Claude Sonnet 5发布一天差评多。虽官方定位高,有能力亮点,但在中文测评中性价比低,测试成本高,且Max推理模式易过度思考。还因过度保守失去实用价值,其表现取决于使用场景和预算。
Unsloth发布Qwen3-VL本地运行和微调指南,修复隐藏bug
Unsloth团队修复Qwen3-VL系列模型聊天模板语法问题,重新上传GGUF量化文件,使模型可本地稳定运行。介绍了不同规格模型硬件需求、表现,给出部署步骤、参数差异,还展示多模态能力测试,提供多种格式模型及微调工具。
管你模型多大,250份有毒文档统统放倒,Anthropic:LLM比想象中脆弱
Anthropic等联合研究打破传统观念,只需250份恶意文档就能在参数规模从6亿到130亿的LLM中植入后门,且与模型规模及训练数据量无关。研究还测试了特定后门攻击,评估了多种训练配置。
OpenAI「GPT门」事件引爆!Plus、Pro账户统统降配,偷换模型全网实锤
OpenAI被曝在用户不知情下,将GPT-4、GPT-5等模型路由至低算力敏感模型,引发用户对选择权和付费权益质疑。该现象已在社交媒体广泛验证,OpenAI回应称是在测试新安全路由系统。
GLM-5架构曝光,智谱两日涨60%:采用DeepSeek同款稀疏注意力
GitHub代码确认GLM - 5架构细节,它采用DeepSeek - V3/V3.2架构,含稀疏注意力和多Token预测,参数量745B。OpenRouter上神秘「Pony Alpha」被指是其测试版,受消息影响智谱AI港股两日涨60%。
中国AI芯片大突围,DeepSeek V3.1引爆算力革命
DeepSeek V3.1发布,是中国AI技术自主性的战略突围。它有6850亿参数,采用UE8M0 FP8适配国产芯片,具混合推理架构、Agent能力等。其发布或重塑AI产业格局,推动国产芯片发展。
台积电“退场”,氮化镓市场影响几何?
近日,纳微半导体宣布将产品代工从台积电转至力积电,台积电决定2年内退出氮化镓业务。因其代工业务利润低,难达预期,且氮化镓市场竞争激烈。但氮化镓厂商积极应对,市场前景仍被看好。
Claude Fable 5.1与GPT-5.6社区一手实测
Anthropic的Claude Fable 5.1刚上线,社区就将其与OpenAI的GPT - 5.6 Sol实战对决。采用同一提示词等严苛规则,结果Fable 5.1细节碾压但有bug,成本高;GPT - 5.6 Sol成本低、风格稳定。还给出选型参考。