「真实世界测试」共找到 2937 篇相关文章
AI下半场的战场,从Agent记忆体正式打响
OpenClaw开源项目爆火,标志AI进入下半场走向真实应用。关键在于解决AI在现实中持续干活的问题,核心是Agent Memory。论文梳理该赛道,指出其是系统级记忆体结构框架,未来关键在memory策略可学习。
CL-Bench的故事没有结束,生成式CL-Bench:GENIUS来了
北大团队发布GENIUS,用于评估模型生成式流体智力。它构建含510个样本、20个子任务的评测集,测试模型多方面能力。实验显示当前模型流体智力有短板,还提出免训练注意力校准机制提升性能。
32k微调处理百万Token:21倍的推理加速,10倍的峰值显存节省,实现恒定内存消耗
现有大模型处理超长文档易内存爆炸、计算崩溃。阿里巴巴未来生活实验室推出CoMeT架构,有双轨并行记忆系统,能恒定内存、线性时间处理文本,在基准测试超主流方法,实现21倍推理加速和10倍显存节省。
我烧了上亿token玩Clawdbot,结果发现国产平替更香,还免费。
作者花上亿token研究Clawdbot,发现其虽火但贵,Cowork也因收费和网络限制被盖过热度。作者转而探寻国内平替,介绍阿里云上线Moltbot云服务,重点推荐阿里QoderWork,测试后认为它是能打的免费平替。
5Y News|Kimi发布并开源 K2.5 模型,带来全新视觉理解、代码和Agent集群能力
2025年1月27日,月之暗面发布并开源Kimi K2.5模型,它是迄今最智能全能的模型,在多任务有出色表现。支持多模态输入,具备新能力,还推出Kimi Code工具,集群能力也开启Beta测试。
AI用3年时光,来了解你!首个AI Clone长期记忆基准
现有AI记忆评测存在数据源单一、忽视变化本质、注入成本高等局限。开源学术社区QuantaAlpha联合高校团队提出CloneMem基准测试,构建合成人生,设计评测任务,实验发现简单方法在检索上更有效,记忆系统应还原信息。
用2D先验自动生成3D标注,自动驾驶、具身智能有福了丨IDEA团队开源
IDEA团队张磊团队提出OVSeg3R开集3D实例分割学习新范式。它无需人工后处理和3D掩码标注,降低训练成本,有望让3D实例分割商业落地,可用于自动驾驶、智能家居等领域。
我们对 Coding Agent 的评测,可能搞错了方向
用户对 Agent 不满常因它「做得不好」,不遵循指令和规范。当前主流评测体系以结果为导向,与真实场景错位。MiniMax 开源 OctoCodingBench 评测集,结果显示模型过程规范遵循不足,未来训练需引入过程监督。
AI开始“动手”了,全世界第一个带头的是阿里千问
阿里千问App上线400多项新功能,依托Qwen模型和阿里生态,在全新Agent架构下提升AI能力。它能在购物、旅游、办公等场景帮用户办事,使AI具备现实世界落地能力,推动人机交互跃迁。
蚂蚁再把医疗AI卷出新高度!蚂蚁·安诊儿医疗大模型开源即SOTA
蚂蚁集团联合多方开源的医疗大模型蚂蚁·安诊儿(AntAngelMed),一经发布就登顶多项医疗基准测试榜单,是迄今参数规模最大的开源医疗模型,应用门槛低,为行业示范出一条清晰路径。