「评测机制」共找到 1466 篇相关文章
让GUI Agent不再「边做边忘」:快手、浙大提出MemGUI-Agent,攻克长程GUI任务
手机GUI Agent在长程任务中易遗忘关键信息,浙江大学APRIL实验室和快手主站技术部提出MemGUI - Agent,核心是ConAct,将上下文管理变为Agent动作,还开源MemGUI - 3K数据集,模型在评测基准取得佳绩。
OpenAI 全面拥抱 Agentic-First,实测有点扎心
OpenAI发布GPT - 5.6系列,Sol定位长周期Agent,训练目标转向Agentic - First。但目前难以用上Sol,且其评测数据因计数规则差异大,还出现变身话痨、少说话和干完活难兼顾的问题。
挺搞笑,MiniMax模型就是不认识「马嘉祺」
网友发现 MiniMax 模型不认识「马嘉祺」,不同接口和平台均能稳定复现。这或因训练数据清洗和分布问题,使特定词汇生成异常。论文指出 tokenizer 机制缺陷或致模型异常,问题不会随参数规模增大消失。
硬核拆解 OpenClaw:如何构建真正稳健的生产级 Agent 系统?【上】
本文深入剖析 OpenClaw 的 Agent 任务引擎,介绍其‘工作室’、整体架构、调度与并发控制、高可用与容错机制等。指出其架构有工程智慧,对构建生产级 Agent 系统有参考价值,下篇将介绍更多实践。
智普入局OCR! GLM-OCR 0.9B 也杀进来了~
OCR是上古任务,如今大模型纷纷入局,用1B以下小参数模型搅动解析市场。GLM-OCR能做文本识别等,采用三级架构,有两阶段流水线及训练机制创新,在多场景表现出色。
VinciCoder:多模态统一代码生成框架和视觉反馈强化学习,数据代码模型权重已开源
中科院与美团团队推出 VinciCoder,打破多模态代码生成中 SFT 范式瓶颈。它将奖励机制转向视觉域,通过两阶段策略统一多样化代码生成任务,在多基准测试中表现卓越,为领域研究提供新范式。
拜拜了GUI!中科院团队“LLM友好”计算机使用接口来了
中科院软件所团队研究指出,现有LLM智能体成功率低、效率差的瓶颈在于GUI。其设计与LLM能力错配,团队提出声明式接口GOI,实现策略 - 机制分离,经测试性能提升显著。
Andrew Karpathy最新访谈:RL很糟糕、人类学习和教育、智能和文化的演变、AGI还要十年,将带来2%的GDP增长
Dwarkesh Patel 播客对 Andrej Karpathy 进行深度访谈。他认为 AGI 还需十年,目前算法有缺陷;强化学习虽有问题但必要;分析了 LLM 局限,探讨人类学习机制、AGI 经济影响等多方面内容。
拒绝“熵崩塌”和“熵爆炸”!这项研究让大模型学会“精确探索”,推理成绩飙升
2024年以来,大模型在推理任务上进展显著,得益于RLVR方法,但面临“熵困境”。研究团队提出选择性熵正则化方法(SIREN),通过三重机制精准调控探索行为,实验证明其能提升模型推理成绩。
大模型解数学题是真懂还是 “死记硬背”?|首个反例驱动的数学推理基准揭穿 “刷题式假象”!
随着大语言模型在数学领域应用渐广,其是否真具备数学推理能力成焦点。清华等团队提出反例推理评测基准COUNTERMATH,测试20+主流模型,结果不佳,而小样本微调能显著提升模型能力。