「代码智能」共找到 4811 篇相关文章
实测MiMo-V2.6,这个小米直播烧了347万美元训出来的模型到底怎么样?
本文作者实测小米花费347万美元训练的开源大模型MiMo-V2.6,从多类真实场景测试模型能力,分析性能成本与实际体验,给出客观真实的测评结果。
开启Benchmark的Harness时代:15家学术机构联合发布HarnessEval
8月13日,DeepSeek开源Agent Harness dsh引发行业对“Harness”的关注。近日,MirroS联合多机构发布HarnessEval,将其概念引入评测系统。它使评测从Metric到Harness,形成可执行评测系统,已落地于交互式世界模型。
InfoQ 2026 年趋势报告:AI 重写工程师角色,但一切仍然关乎人
InfoQ 2026 年趋势报告探讨了 AI 对软件开发的影响,包括重写工程师角色、团队演变等。嘉宾指出 AI 采用应结合风险和业务场景,巩固基础,重新设计审查流程,关注质量和人的因素。
「说 Harness 会被淘汰的,肯定没做过工程」,Kimi 前 CLI 负责人戳破了 AI 圈最大的误解
AI编程圈两极分化,围绕底层Harness是否消失争议不断。前Kimi CLI负责人stdrc提出反常识观点,认为模型越强Harness越厚,复杂度从“能力层”转移到“协作层”,还以Kimi CLI实践及Raft创业为例阐述。
GPT-5.4 仅 11.36%!当大规模工具生态变成迷宫,LLM Agent 还能完成长程规划吗?
PlanBench-XL 来自 UIUC 团队,将 LLM Agent 放入零售 API 世界,评测其长程规划能力。它考虑真实工具环境挑战,含 327 个任务等,发现多数模型规划难、恢复差等问题,并给出改进启示。
让机器人学会“预判接触”:它石智航牵头四大顶尖机构发布TacForeSight,破解精细操作难题
它石智航联合四大顶尖机构发布论文“TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation”,提出力条件触觉世界模型,让机器人能提前预判接触变化,在精细操作领域取得关键进展。
GAIR Paper 106|追踪视觉 Token 的演化轨迹,实现无损压缩与 60% 推理加速|CVPR 2026
近年来大视觉语言模型虽推动多模态智能发展,但推理成本高昂。山东大学和MBZUAI团队提出TransPrune,从演化视角衡量视觉Token重要性,保持性能无损同时降低60%推理成本。
AI撑爆GitHub!天天宕机,18年老兵带5万星项目「决裂出逃」
GitHub第1299号用户、Vagrant之父Mitchell Hashimoto,因GitHub连续宕机和AI转型,带着5万星项目Ghostty出逃。AI让GitHub负载剧增,其资源向AI倾斜致基础设施维护变差,“去GitHub化”声音渐大。
吴恩达:最快的团队,人人都是产品经理
吴恩达在最新编辑信中指出,AI编程工具提升开发速度后,瓶颈转移到‘决定做什么’。传统团队配比失衡,最快团队让工程师身兼PM和工程师。Claude Code团队实践与之相符,AI时代人人应成通才。
《动手写AI Agent》权限与安全:让 Agent 不敢乱来
文章指出LLM不理解操作后果,不加权限的AI Agent如定时炸弹。介绍权限模型设计,采用Deny→Ask→Allow三层过滤;给出权限规则结构,用glob模式匹配工具参数;还解释用glob而非正则的原因。