「国产开源LLM」共找到 4106 篇相关文章
让LLM扔块石头,它居然造了个投石机
港中大研究团队带来《Agentic Design of Compositional Machines》,推出BesiegeField平台,支持并行实验和大模型‘自我进化’。它将机械设计转为语言生成任务,通过闭环训练提升模型能力,多个模型测试表现良好。
OpenAI、Anthropic、DeepMind联手发文:现有LLM安全防御不堪一击
OpenAI、Anthropic、Google DeepMind 联手发文,研究语言模型安全防御评估。指出现有防御评估有缺陷,提出通用自适应攻击框架,成功绕过 12 种防御机制,多数攻击成功率超 90%。
250份文档投毒,一举攻陷万亿LLM!Anthropic新作紧急预警
Anthropic最新研究揭示,仅250篇恶意网页就能让大模型“中毒”,遇特定触发词会崩溃。研究还设计DoS型后门攻击,验证不同规模模型攻击效果。同时指出AI开放性易被操控,而Anthropic注重安全,有“防爆层思维”。
Meta开源首个320亿参数代码世界模型CWM
Meta FAIR发布320亿参数的研究模型Code World Model (CWM),用“世界模拟”方式处理代码,试图真正“理解”代码逻辑。它在Math - 500数据集测试成绩亮眼,模型权重开放,可多渠道下载。
免费、开源!谷歌Gemini CLI彻底火了,平替Claude Code
谷歌开源的Gemini CLI火了,它能运行在终端,有谷歌Gemini Pro 2.5功能且基本免费。擅长编程等,与AI编码助手集成,有高免费额度,还具多项强大内置工具,或成Claude Code劲敌。
Cache Me If You Can:陈丹琦团队如何「抓住」关键缓存,解放LLM内存?
普林斯顿大学陈丹琦团队新论文聚焦长上下文语言模型 KV 缓存问题。传统 KV 缓存大小随输入文本长度线性增长,此前方法难公平比较。团队提出「KV 足迹」指标,改进方法并推出 PruLong 优化内存,节省空间且保性能。
企业数字化转型新引擎:MCP + LLM + Agent 架构赋能!
本文介绍MCP(Model Context Protocol)模型上下文协议,它是Anthropic于2024年11月底推出的开放标准,可统一大模型与外部数据源和工具通信协议,打破数据孤岛,有诸多优势,还适用于多个场景。
4000亿国产算力航母:芯片巨头合并超算巨头
上交所披露海光信息拟换股吸收合并中科曙光并募资,两家公司A股自5月26日开市起停牌,预计不超10个交易日。海光聚焦芯片研发,中科曙光深耕服务器领域,重组方案待明确,实施有不确定性。
腾讯开源全新动作迁移模型FlexiAct,人物 & 动物都支持
当前动作定制方法在应对多样化主体和场景时适应性差,清华与腾讯提出FlexiAct模型。它引入RefAdapter和FAE,能在空间结构差异大或跨域场景中精准适配动作,保持外观一致,表现优于其他方法。
本地运行、支持视觉与工具调用:Meta 开源智能体模型
Meta AI Research 推出 300 亿参数的开放权重模型 Muse Glimmer,采用 Apache 2.0 许可证。它专为本地工作流设计,能在消费级硬件运行,经多项优化,在基准评估中表现出色,还支持多种框架。