进化式评测系统」共找到 2751 篇相关文章

开源动态8

用多模态LLM超越YOLOv3!强化学习突破多模态感知极限|开源

华中科技大学、北京邮电大学等多所高校研究团队共同推出纯多模态开源LLM——Perception-R1,该模型用强化学习优化视觉感知,目前论文和代码均已开源,其在视觉任务上表现出色,为后续研究提供强大baseline。

量子位
开源动态7

DeepSeek Harness和V4 Pro正式版同时重磅上线,一手实测:DSH更像是AI操作系统

DeepSeek V4 Pro正式版0813上线,升级Agent能力,网页、API、app皆可用。DeepSeek Harness亮相并开源,基于“一切皆插件”理念。V4 Pro跑分部分能力突出但价格将涨,其实际表现待更多测试。

AI寒武纪
开源动态8

Agent的自演进,被刚刚开源的AReaL 2.0按下了加速键

Agent 正从「会使用工具并完成任务」向「在使用中学习并改进方法」转变,但面临自演进难题。AReaL 2.0 上线,解决 Agent 服务侧问题,给出在线学习闭环方案,其价值已在实践中得到验证。

机器之心
开源动态8

1.5K Star!网页提取神器 webclaw:让 AI 精准抓取网页核心内容!

webclaw是专为AI工作流打造的高性能网页提取工具,能把网页转成适合大模型的内容。它有Token优化、极速响应等亮点,支持多种安装和使用方式,解决了传统抓取工具的痛点。

开源星探
推荐文章7

王云鹤眼中的Harness:复杂优化问题,AGI灵魂争夺之战

王云鹤在知乎文章中探讨Harness Engineering,指出Agent=Model+Harness,多模型配合能提升Agent能力。还分析Harness存在的必要性,认为它是复杂优化问题,关乎AI“灵魂”之争。

机器之心
开源动态8

超越VLA与世界模型,银河通用发布LDA,全谱系数据跑通Scaling Law

近期具身智能领域竞争激烈,银河通用联合多机构发布 LDA-1B 模型,能统一利用各类具身数据。它在基准测试中表现出色,代码已开源,还解决了数据格式、质量等问题,实战效果也很突出。

机器之心
算法论文8

跳过88%专家,保住97%性能!MoE推理的正确玩法| CVPR’26

多模态大模型走向大规模,MoE架构虽降低计算开销,但推理成本仍高。香港科技大学等团队提出MoDES,它是training - free动态专家跳过框架,能跳过88%专家还保留97%性能,推理速度提升2倍。

新智元
开源动态7

走出 MMLU 的高分幻觉:AI Agent 的「斯坦利时刻」与职场生存法则

文章指出多模态大模型在基准测试分数高,在实际业务流程却像‘职场巨婴’。研究团队构建Trainee - Bench测试顶尖模型,结果显示模型离‘独立上岗’远,凸显提升Agent自主学习性的重要性。

AI科技评论
开源动态8

腾讯Kuikly框架鸿蒙版正式开源 —— 揭秘卓越性能适配之旅

腾讯将广泛使用的跨端开发框架Kuikly鸿蒙版正式开源,已接入多款业务。它有高性能、动态化特点,适配中解决渲染、文本性能等问题,还优化调试效率,发布Compose DSL Beta版。

腾讯技术工程
新闻资讯7

Markdown要凉…卡帕西也站HTML了

Anthropic工程师Thariq发文呼吁抛弃Markdown,力推HTML,认为其在信息密度、可读性等方面优于MD。卡帕西也认可此观点。不过HTML存在费token、版本控制难等问题,文中也给出了应对建议。

量子位