「代码编辑框架」共找到 3294 篇相关文章
MMAR与AudioTrust技术解读,音频大模型评测前沿进展分享 | AI Bench Talk直播预告
司南评测集社区 CompassHub 收录多维度评测集。此次 AI Bench Talk 直播聚焦音频大模型,将分享评估其深度推理能力的 MMAR 及全方位可信评估框架 AudioTrust,还设圆桌讨论多模态/音频大模型相关议题。
一招缓解LLM偏科!调整训练集组成,“秘方”在此 | 上交大&上海AI Lab等
上海交大和上海AI Lab联合团队提出IDEAL方法,可提升LLM综合性能。研究发现SFT阶段数据数量非关键,配比不当会加剧模型“偏科”。以Llama3.1 8B测试,IDEAL能提升代码能力,还指导了超参数选取。
字节Seed新作:模型合并如何改变大模型预训练范式
字节跳动Seed团队在arXiv发表论文,提出预训练模型平均(PMA)技术。该技术将模型合并引入预训练阶段,可提升性能、预测衰减阶段表现,还能解决训练问题。不过,高学习率影响和强化学习应用待研究。
面向多工具任务调度的两种路径:MCP vs Agent + Function call
本文围绕大语言模型智能应用中的工具与数据接入问题,介绍了基于 Agent + Function Call 的动态调度机制与基于 MCP 的标准化接入框架,分析了不同场景下的适用性,还探讨了二者未来的协同融合方向。
微软开源浏览器Agent,可实时跟踪、控制智能体,超4000颗星
微软在官网开源用于浏览器网络任务的Agent——Magentic - UI,基于Magentic - One开发,支持人机协同。GAIA测试显示其能提升任务完成率和准确率。它以人为本,有独特机制,框架含多阶段,在Github超4000颗星,支持MIT许可证商用。
同一天,Cursor、ClaudeCode都把 Agent 的手脚伸进了你的内网
9月2、3日,Cursor和Claude Code分别发布功能,让AI Agent工具执行跑在用户网络而非云上,解决企业代码不出内网痛点。这标志AI编程工具进入to B基础设施之争,不过要关注安全信任问题。
深度拆解 DeepSeek Harness 架构:AGI 的自进化,终于有了「后悔药」
8月13日,DeepSeek开放DeepSeek Harness v0.1开发者预览版,在Github获4.5万星。它提出“一切皆插件”概念,核心组件可插拔。还联合北大提出Cordis框架,解决组件插拔问题,但面临价格与组件膨胀挑战。
GCEA-YOLO:给油田装上"防火眼",把抽烟行为检测精度拉高 20.8%
油田抽烟事故损失大,传统检测方法有局限,深度学习模型也面临难题。作者基于YOLOv11n构建GCEA - YOLO网络,含ADown、CSP - EDLAN、GFPN、EfficientHead四个模块,检测精度显著提升,还验证了泛化与稳定性,并给出复现代码。
AI给你的总是平庸答案?5.8万星插件证明:问题不在模型,在你
GitHub上5.8万星的`taste-skill`仓库,无模型代码,仅用文本规则让AI编程工具输出更有品味。揭示AI默认给平庸答案是概率采样结果,还给出反中位数三问及AI时代变贵的是判断力。
构建 AI 时代的知识底座:直播数据 LLM Wiki 实践
文章围绕直播数据 LLM Wiki 实践展开,指出领域知识沉淀面临挑战,引出 LLM Wiki。介绍其实际效果,如指标召回、代码生成等,阐述构建方法、架构设计、编译流水线、检索方式,还提及增量编译与持续 Lint,最后给出未来规划。