「评测报告」共找到 1014 篇相关文章
打通AI4S数据入口:MinerU.Chem让化学文献中的“图片”,从“人类可读”走向“AI可用”
上海人工智能实验室 OpenDataLab 团队发布 MinerU.Chem 技术报告及成果,升级化学文献智能解析能力。它能将化学文献图片转化为 AI 可用数据,解决化学知识机器难用问题,在评测中领先,还将助力 AI4S 发展。
拒绝传统 Router“瞎指挥”,多智能体如何实现智能任务分配?
企业级多智能体系统瓶颈常是负责分发任务的传统 Router 太“傻”,搞不定跨域、解不了冲突、跟不上变化。腾讯云开源 TCAR 智能路由模型,它先推理再选 Agent 集合,经多数据集评测表现出色,还提供完整开源范式。
Arc研究所造出能“举一反三”的虚拟细胞模型,破解跨细胞预测难题
生物学和药物研发中,因细胞组合庞大,难以全实验验证,且同药在不同细胞效果不同。Arc Institute 团队推出虚拟细胞模型 STATE 及评测套件 Cell - Eval,STATE 预测效果优,但也存在短板。
一篇大模型Agentic框架到应用最新综述
这是首篇系统拆解“大模型Agentic推理框架”的综述,不聊训练,只聚焦如何把LLM组织成会思考、协作、调工具的Agent,横跨科学发现、医疗、软件工程、社会经济模拟四大战场,给出统一语言、视角和评测。
AMD:“拿捏”了英特尔,还要给英伟达“上强度”?
2025年第一季度财报显示,AMD营收74.4亿美元、净利润7.1亿美元,同比双升。客户端业务超预期,桌面级CPU份额反超英特尔;数据中心业务增长,GPU待新品发力。不过,MI308出口受限或影响业绩。
刚刚,美团推出 136 亿参数视频生成模型
美团推出 136 亿参数视频生成基础模型 LongCat-Video,采用 MIT 开源协议。该模型覆盖文本、图像生成视频及视频续写三类任务,能生成分钟级长视频。效率高,评测数据表现佳,安装和运行简便,引网友惊叹。
AIGC全生命周期业务风控白皮书,从备案到运营的合规与安全实践
2025年9月15日《人工智能安全治理框架》2.0版发布,为AI风险防控指明方向。数美科技发布《AIGC全生命周期业务风控白皮书》,构建全生命周期业务风控体系,涵盖合规备案、安全评测、账号与内容风控等多方面。
ICCV 2025 | ECD:高质量合成图表数据集,提升开源MLLM图表理解能力
科研等领域图表是信息核心载体,先进开源MLLMs在高难度图表理解测试准确率低。本文提出ECD数据集,规模大、质量高、风格多样,还设计合成流水线与评测基准ECDBench,为开源MLLM提供支持。
没有全科优秀,具身模型别想进入百万小时
文章介绍权威评测 RoboDojo,给全球机器人模型办‘高考’,多数具身模型离落地远。原力灵机的 DM0.5 模型登顶,它记忆能力强、全科优秀,且全面开源,有望推动具身智能发展。
马斯克版微信,终于来了!
4月12日苹果App Store刷出XChat,开发者为X Corp.,将于4月17日上线,中国大陆区也开启预约。它被看作‘马斯克版微信’,无广告、不追踪、全加密,集成AI Grok,或重塑全球社交格局。