「自演进评测」共找到 1879 篇相关文章
开源AI开发生态大洗牌:低代码平台逆袭,传统LLM框架日渐式微
第十届527蚂蚁技术日,蚂蚁对现有开源生态全面剖析,发布2025大模型开源生态全景图。分析显示开源生态有三个主导技术赛道,还总结出七大趋势,为从业者提供生态演进规律参考。
Astra 的 Computer Use 能力是如何实现的?
本文编译自Browserbase增长工程师Kyle Jeong的个人博客,对比了纯视觉路线Computer Use模型的缺陷,详细拆解Astra模型利用无障碍树结合Codex Harness实现能力的架构、训练方法,分析其优劣与行业价值。
EMNLP 2026高分论文MathDebugger:当合成数据涌入训练集,如何为数学题做体检?
随着合成数据增多,模型需判断数学数据题目能否被信任。北大DCAI团队提出MathDebugger质检BenchMark,覆盖问答两端,评测主流LLM和PRM。还探究能否判断正误、分类错误、修复数据,证明错误标签可作监督信号。
5.9K Star!告别 AI 画图的“廉价感”,这个开源项目让你的图表高级又有品味!
技术写作者兼产品设计师Cathryn Lavery因不满Claude画图效果,开发开源项目diagram - design。它是Claude Code的技能插件,输出自包含HTML文件,有多种图表类型、品牌定制等亮点,解决AI画图审美痛点。
Qwen3-VL-Seg 深度解读:当多模态大模型学会"像素级精准手术",仅用0.4%参数碾压8B模型
文章深度解读阿里通义实验室发布的Qwen3-VL-Seg,它解决开放世界指代分割问题,用仅17M参数(占基础模型0.4%)在4B规模超越8B模型。介绍其原理、架构、数据、实验结果,还给出实战代码。
杀疯了!单卡4090跑通全量微调,面壁1B级多模态性能怪兽硬刚大厂
面壁智能推出MiniCPM-V 4.6,参数约1B,性能和推理效率出色。它在多模态任务综合能力、推理速度上领先竞品,靠ViT架构改造和4倍/16倍混合视觉Token压缩实现创新,有工业验证,对开发者和普通用户意义大。
两分钟Claude Code模型换成DeepSeek,立省17倍,缓存后爆省120倍
GitHub开源deepclaude,两分钟可将Claude Code模型换成DeepSeek V4 Pro,开销直降17倍。自带上下文缓存机制,重复对话成本降120倍。支持多后端选项,可丝滑切换,还能打破设备限制远程编程。
当我把 AI 变成一个"算法":Skill 工程化设计的心路历程
作者分享将 Agent 工程化设计的历程。指出 LLM 做 Agent 有痛点,引入 CLI 接管确定性任务和上下文管理,还设计了 Workflow 串联工具,实现自动扩展和无缝互转,最后做 workflow - creator 形成自洽闭环。
刚刚,何恺明团队新作,「嵌入式语言流」ELF来了
何恺明团队提出ELF模型,将扩散过程置于连续向量空间,只在最后翻译成词。它用一个网络实现去噪和解码,引入自条件机制。实验显示,ELF用不到其他方法十分之一数据,生成质量全面领先。
当 70% 的人将拥有智能体,谁来给 AI 建底座?澜舟科技周明:大模型落地的最后一道墙是“可信 AI”
4月16日澜舟科技春季沟通会,创始人周明分享智能体到数字员工演进等内容。指出AI进入落地新阶段,提出可信AI和智能体工程,展示相关技术体系、产品矩阵及行业方案,回答企业级AI现实问题。