「评测系统」共找到 2238 篇相关文章
谷歌重磅开源 A2UI,这将会是2026年Agentic UI的王炸级标准!
过去人和AI交互多靠文本框和语音,实际应用中存在问题。谷歌开源A2UI,是AI Agent和用户界面的中间层协议,核心是声明式JSON和客户端原生渲染,有多种能力,还给出快速入手步骤。
BellSoft 发布 Java 加固镜像
BellSoft 在 KubeCon 2025 大会发布新的“加固镜像”产品,集 Java 运行时优化、操作系统加固与主动 CVE 修复于一体,可减少已知漏洞、降低资源消耗,还提供 SBOM 满足合规需求。
DeepSeek V3.2爆火,Agentic性能暴涨40%解密
文章解密了DeepSeek V3.2 Agentic性能暴涨40%的原因,即采用交错思维链机制。还对比了其与早期ReAct范式,介绍其效果、原理,以及MiniMax为落地该机制做的工作,最后提到多家模型达成技术共识。
GPT-5得分不到0.4!法律+金融最大规模基准:1.9万+专家评估准则
新推出的PRBench基准可测AI在金融和法律领域表现。它有19356条专家评估准则,是该领域最大公开基准。顶尖大模型在困难子集得分低,还独创经济路径分析维度,约30%任务为多轮对话,揭示了AI在专业领域的不足。
我的AI OS搭建思路
作者黄益贺分享AI OS搭建思路。其系统以Claude Code为框架、Kimi K2 Thinking为模型,通过Skill和自定义命令满足工作需求,设计三层文件夹体系处理信息,供大家参考搭建。
刚刚,Dexbotic开源!VLA性能+46%,机器人叠盘子100%成功,统一具身智能底座
Dexmal原力灵机开源的Dexbotic是具身智能VLA模型一站式科研服务平台,可提供基础设施。其预训练模型在多仿真器中提升传统VLA策略,还推出开源硬件DOS - W1,覆盖训练需求,架构有创新。
卡帕西:强化学习很糟糕,但其他所有方法都更糟
卡帕西在近两小时访谈中解答诸多问题。他认为AGI成熟约需十年,现有的LLM有认知缺陷,强化学习糟糕但其他方法更差,AGI将延续2%GDP增长趋势,还谈及自动驾驶、教育等方面看法。
腾讯混元图像3.0开源榜一,工业级800亿参数可商用,附提示技巧
28日,腾讯开源800亿参数的工业级原生多模态生图模型HunyuanImage 3.0,个人和月活≤1亿公司可免费用。它是全球参数量最大、性能最好的开源图像生成模型,技术强、评估表现优,官方还整理了提示词手册。
承认自己开源不行?转型“美国DeepSeek”后,两个谷歌研究员的AI初创公司融到20亿美元,估值暴涨15倍!
AI创业公司Reflection AI由两位前Google DeepMind研究员创立,一年完成20亿美元融资,估值达80亿美元。它从编码智能体起步,现转型为开源替代公司,主打“开源”牌,计划明年推前沿语言模型。
听说,大家都在梭后训练?最佳指南来了
大模型时代,Scaling Law 边际效益递减,业界转向后训练。《Post-training 101》博客可助初学者入门,涵盖从预训练到指令微调、SFT 原理、多种强化学习技术及模型评测方法等内容。