「长青评估机制」共找到 1534 篇相关文章
Claude Code完整技术栈都被扒出来了,Multi-Agent架构~
analysis_claude_code项目对Claude Code v1.0.33逆向工程分析,含混淆代码技术分析等。发现实时Steering机制、多Agent架构等,为AI agent系统设计实现提供技术参考,还介绍系统架构创新点。
推理正确率下降65.5%!斯坦福、MIT等用「不等式」拷问AI逻辑极限
大语言模型在数学证明常现推理漏洞,斯坦福等高校团队提出IneqMath基准评估其严谨性。用不等式证明题切入,拆解为子任务,构建评测体系,用LLM - as - Judge审查。结果显示模型推理正确率低,存在结构性缺陷。
DeepSeek-OCR 2再进化,对图像理解已经像人一样逻辑推理了
DeepSeek-OCR 2升级,保持前代高效压缩率和解码效率,引入DeepEncoder V2,模仿人类视觉因果流机制,将图像理解转为逻辑推理,在文档解析领域实现逻辑重构,性能显著提升。
All in AI 两年,AI 代码采纳率突破 50%!安克创新龚银:AI 平台一旦过时,我们会毫不犹豫重构
安克创新2023年决定All in AI,探索适配内部运营与新的产品形态。这两年有项目放弃也有成果,如代码采纳率突破50%。其评估AI落地可行性关注业务、技术、团队成熟度,还采取差异化管理应对创新的ROI问题。
GAIR Paper 105|离线强化学习新突破——ROMI:破解对抗式模型学习「过保守、训不稳」深层困局|ICLR 2026
本文聚焦基于模型的离线强化学习,指出RAMBO算法存在保守性难控和训练不稳问题。为此提出ROMI方法,引入鲁棒价值感知框架与隐式可微自适应加权机制,在多基准任务上超越基线算法。
阿里重磅开源!Open Code Review:一周 5k star,为你的代码保驾护航
阿里开源 Open Code Review,它前身是内部 AI 代码评审助手,经大规模验证。该工具结合确定性工程与 Agent,解决通用 Agent 评审代码的问题,在准确率、效率等方面表现出色,还介绍了使用方法和评估方式。
一年磨一剑,今年最炸机器人Demo来了!1亿美元种子轮团队出手,单个模型解锁单手打蛋解魔方弹钢琴
Genesis AI发布机器人基础模型GENE - 26.5,让机器人可自主完成烹饪、实验室操作等复杂任务。该团队全栈自研,从硬件、数据、模型到训练评估都有独特方案,曾获1.05亿美元种子轮。
AI邪修时刻!Meta联手MIT投毒,左脚踩右脚强行升天
Meta的SOAR架构用错误率高的数据让模型推理能力暴涨9.3%。它选难题子集,用‘教师模型’生成含错题的‘垫脚石问题’,通过‘双层博弈’和‘有根奖励’机制让模型进步,或成AI进化新方向。
清华孙茂松团队 × 深言科技:以解释作为训练信号,让 8B 模型在幻觉检测上反超闭源大模型
大语言模型幻觉问题待解,成本与算力需求攀升。清华孙茂松团队联合深言科技提出FaithLens模型,把幻觉检测提升为整体评估,以解释作为训练信号,8B模型在多任务上超闭源大模型。
“别再碰我代码!”明星AI工具成瘟神,用户怒斥:一周七千块,修不好bug还删我关键文件!
AI编程服务提供商Replit推出新一代AI编程助手Agent 3,CEO称其为软件“自动驾驶时刻”。但用户反馈它修不好bug还删关键文件,成本也高,Replit回应强调“模型栖息地”和“事务性”机制重要性。