LLM微调库」共找到 1420 篇相关文章

产品应用8

实测!DeepSeek V4-pro是第一个接近Claude开源模型,前Meta研究员震惊

DAIR.AI创始人、前Meta AI研究员Elvis用DeepSeek - V4 - Pro在Pi框架搭LLM知识,该模型开箱即用,完成知识密集型多步研究任务表现出色,在开源模型里Agent编程和推理能力强,架构设计让推理快且成本低。

AI寒武纪
8

刚刚!Kimi Linear横空出世,全新注意力架构:1M长文本解码速度飙升6.3倍,KV缓存砍掉75%

月之暗面推出全新注意力架构Kimi Linear,有望成下一代Agent LLM基石技术。它解决了LLMs处理长序列任务的瓶颈,性能超传统机制,还开源了核心代码。Kimi Linear的KDA模块提升了表达和硬件效率,实验表现佳。

AI寒武纪
开源动态8

跨芯片统一优化,DLCompiler与DLBlas驱动算子极致表现

9月10日,上海AI实验室DeepLink团队开源DLCompiler和DLBlas。前者是扩展Triton的深度学习编译器,后者是面向大模型的高性能算子。它们有跨架构DSL扩展等亮点,在多芯片上实现性能优化,还解决了DSA芯片优化难题。

OpenMMLab
算法论文7

清华唐杰新作:大模型能打掼蛋吗?

清华、北邮等团队联合研究表明大模型能打掼蛋等8种棋牌。不同模型在不同棋牌表现有差异,如GPT - 4o综合佳,GLM4是“全能型选手”。研究还探讨学习方法、模型性能影响因素及游戏间相互作用等。

量子位
产品应用8

RL后训练步入超节点时代!华为黑科技榨干算力,一张卡干俩活

在大模型竞赛白热化当下,强化学习后训练成突破LLM性能天花板核心路径,但算力浪费和集群效率低是难题。华为团队祭出两大黑科技破局,在超节点实现训推共卡,资源利用率翻倍,还提升训练速度。

新智元
产品应用8

Harness Engineering: C 端 AIGC 内容生产自优化实践

文章介绍蚂蚁保保险快查深度解读页面生成系统(DIPG),它将Harness思想用于C端AIGC生产链路。DIPG采用‘离线生成+校验+刷入DB’模式,解决LLM实时生成时延和质量问题,还阐述多Agent协作、校验机制及回灌流程等。

阿里云开发者
产品应用7

和Anthropic CEO一起发过Nature,他用Claude Code复活三年烂尾代码

华盛顿大学首席开发者Brendan MacLean用Claude Code复活三年烂尾代码。他像带实习生一样带Claude,构建上下文让其理解代码。同一周OpenAI开源Symphony,实现任务自动派Agent。二者路线不同但目的相同,都在探索让AI融入工程流程。

新智元
开源动态8

9.7K Star 把 AI 编码的 token 消耗砍了 16 倍

当前AI编码工具默认读取整个项目文件,token消耗高。code-review-graph项目用Tree-sitter解析代码成图,追踪改动“爆炸半径”,平均省8.2倍token,技术轻量,还能做社区检测。它揭示AI编码瓶颈在信息输入质量。

CourseAI
新闻资讯7

架构彻底重构!DeepSeek新模型代码曝光,要来的V4让国内外都坐不住了?

DeepSeek官方GitHub代码曝光代号“MODEL1”新模型线索,或为V4内部代号。代码显示其有重大架构变更,能并行处理稀疏与稠密计算,适配英伟达新架构。此前R1发布推动中国AI开源生态发展,新模型备受期待。

InfoQ
新闻资讯7

推理之父走了!OpenAI七年元老离职:有些研究这里没法做

新年伊始,OpenAI研发副总裁Jerry Tworek离职,他是编程和两大核心技术路线奠基者,攻克LLM编程和复杂推理商业化难题。他称想探索在OpenAI难开展的研究。此前已有多位核心人才出走,OpenAI或因商业化与安全问题留不住人。

新智元