「LLM微调库」共找到 1420 篇相关文章
有人只用API就猜出了GPT、Claude、Gemini的参数量?社区吵翻了
研究人员李博杰在arXiv发布论文,提出“不可压缩知识探针”评测框架,仅通过黑盒API调用逆向估算LLM参数规模,给出GPT-5.5等模型参数量估算,引发社区广泛讨论与争议。
Clawdbot为何大火?
LLM记忆问题是业界难题,Clawdbot采用极简方式破解,用写Markdown实现记忆。其记忆系统优势明显,如极简易用、透明可控等,但也有劣势,像数据扩容能力有限、功能扩展性不足等。
Mistral 3发布,14B多模态小模型表现优异
Mistral AI第三代模型发布,含三个小型密集模型和稀疏混合专家模型Mistral Large 3,全用Apache 2.0许可。有多项技术亮点,Ollama等支持部署微调,还给出实用配置建议。
刚刚,OpenAI开放GPT-4.1偏好优化DPO,ChatGPT能真正学会你的「品味」了!
OpenAI宣布GPT - 4.1全系列模型支持DPO微调,可让AI通过对比回答学会用户偏好。介绍了DPO原理、适用模型、数据格式、创建任务方法等,还提及开发者反应与技术要点。
集GraphRAG 和 DeepSearch于一体的智能问答系统graph-rag-agent
本项目结合GraphRAG与私域Deep Search,实现可解释、可推理的智能问答系统。亮点有从零复现GraphRAG、创新融合DeepSearch等,具备多模块功能,还有简单演示,地址https://github.com/1517005260/graph-rag-agent/blob/master/readme.md。
大语言模型逻辑评估
现有归因问答评估方法有‘归因短视’问题,研究团队提出 LOGICSCORE 框架,从三维度量化推理质量。在多数据集测试多款 LLM,发现专有、开源模型等存在不同逻辑问题,还分析典型逻辑错误。
性能飙升42%!人大&字节开源10万级 SWE数据集 Scale-SWE
近期,人大和字节开源10万级软件工程数据集Scale - SWE,用首创工作流从GitHub构建真实数据。基于此微调的Qwen3 - 30A3B - Instruct模型测试表现佳,其数据相比合成数据优势明显。
Github 1.8k star Skyvern:AI直接接管鼠标键盘,3行API干掉你写了3年的脆弱XPath脚本!
Skyvern是开源AI浏览器代理,结合LLM和计算机视觉,自动执行浏览器业务流程。它用简单API复刻人工操作,替代传统脚本,解决脚本脆弱、流程复杂等痛点,功能丰富,技术优势明显,适合多业务场景。
MCP协议曝出大漏洞:会泄露整个数据库
最新研究显示,MCP协议存在重大漏洞,攻击者可利用LLM的指令/数据混淆漏洞直接访问数据库。研究者基于Supabase搭建系统演示攻击过程,还给出降低风险的解决措施。
所有Harness终将长成“龙虾”,但最后活下来的只有几只
在用户需求驱动下,工具从 LLM 向 Agent、Harness 再到 Claw 自然进化,但用户能容纳的 Claw 有限。Sam Bhagwat 拆解进化路径,指出各阶段核心竞争力,开发者应抢占用户心智空间。