「GLM4.5」共找到 2985 篇相关文章
构建知识闭环:用CodeBuddy打造自我进化的数据分析体系
腾讯团队为解决数据分析痛点,构建知识闭环体系,利用CodeBuddy设计开发规范、自动生成SQL,将编码从小时级降至分钟级。体系含沉淀、传递、生成、信赖、闭环五环,提升团队效率与协作。
内存涨价赛过黄金,这些存储公司业绩、股价两开花
近期存储价格年内持续飙涨,幅度超黄金。DDR4现货价较年初暴涨200%,部分经销商溢价出售。存储产品涨价源于AI应用扩张,供不应求热潮蔓延至封测端。多家存储公司业绩和股价两开花。
别再只关注KV Cache了! LLM稀疏性新洞察:为何模型越深越稀疏?UNCOMP从矩阵熵给出答案
团队论文UNCOMP获EMNLP 2025主会接收,它提出高效推理框架,从截断矩阵熵视角解释LLM深层稀疏现象。还能识别关键结构、找到最优压缩策略,设计的UNCOMP框架优化KV Cache,实验效果佳。
CapRL:用强化学习突破Image Captioning训练瓶颈,3B模型性能媲美72B
上海人工智能实验室联合团队发布 CapRL,首个将 DeepSeek - R1 强化学习策略用于 Image Captioning。CapRL - 3B 模型在图像描述任务媲美 Qwen2.5 - VL - 72B,已开源,团队持续迭代优化。
推理速度10倍提升,蚂蚁集团开源业内首个高性能扩散语言模型推理框架dInfer
近日,蚂蚁集团开源业界首个高性能扩散语言模型推理框架 dInfer,在基准测试中,其将 dLLM 推理速度较 Fast - dLLM 提升 10 倍以上,攻克推理瓶颈,为开发者提供高效框架,推动扩散语言模型走向成熟。
多个编码智能体同时使用会不会混乱?海外开发者热议
AI编程工具进步快,GPT - 5等模型推动开发自动化。编码智能体成开发常态,但存在问题。独立开源开发者Simon Willison分享并行使用多个编码智能体经验,引发海外开发者热议。
硅谷惊变:12万张H100的挽歌
这是虚构故事,Meta用12万张英伟达H100训练“LLaMA 4 Maverick”,却被中国杭州DeepSeek团队用2000张GPU打败。项目失败成丑闻,扎克伯格成立实验室四处收购遇冷,新负责人管理混乱,实验室乌烟瘴气。
OpenAI 发布《在AI 时代保持领先》企业实战白皮书
OpenAI发布《Staying ahead in the age of AI》白皮书,用数据凸显AI发展态势,基于合作经验总结出Align、Activate、Amplify、Accelerate、Govern五个实战原则,助企业应对AI浪潮。
EMNLP2025 | 揭开LLM训练数据中的中文污染真相,有比“您好”高2.6倍的token?
近年来,大型语言模型虽成功,但训练数据易混入不良内容。论文《Speculating LLMs' Chinese Training Data Pollution from Their Tokens》探索此问题,定义PoC Token,开发PoCDetect和PoCTrace工具,揭示LLMs训练数据污染情况。
开源大模型实战:GPT-OSS本地部署与全面测评
2025年8月5日,OpenAI发布GPT-OSS-120B和GPT-OSS-20B开放轻量级语言模型,采用Apache 2.0开源许可证。文章介绍通过Ollama本地部署GPT-OSS -20B模型的方法,并对其进行AI幻觉、算法、SQL、数学题等测试。