「学科评价体系」共找到 766 篇相关文章
【万字长文】Claude Skills完全指南:从概念到实战
这是万字Claude Skills指南,从概念到实战。介绍了Skills是模块化能力包,有渐进式披露设计,对比了与MCP、Subagent区别,阐述其优势。还讲了创建、设计、使用方法及分类体系,提示安全风险并推荐资源。
我们对 Coding Agent 的评测,可能搞错了方向
用户对 Agent 不满常因它「做得不好」,不遵循指令和规范。当前主流评测体系以结果为导向,与真实场景错位。MiniMax 开源 OctoCodingBench 评测集,结果显示模型过程规范遵循不足,未来训练需引入过程监督。
AI医生终于有了硬标尺!全球首个专病循证评测框架GAPS发布,蚂蚁联合北大王俊院士团队出品
蚂蚁健康与北大王俊院士团队发布全球首个大模型专病循证能力评测框架GAPS及评测集GAPS - NSCLC - preview,解决现有医疗AI评测局限,成果已应用于“蚂蚁阿福”,并客观评价了大模型临床能力。
求稳的安全IP,安谋科技如何守正出奇?|甲子光年
12月24日,安谋科技推出新一代SPU IP——“山海” S30FP/S30P,构建覆盖芯片底层至应用层的一栈式安全防护体系,有抗物理攻击强等五大亮点,能适配不同场景安全需求,完善产品布局。
全美罕见!普渡大学把AI写进“本科毕业条件”,校园炸锅:不会用AI,连毕业证都悬了?
美国普渡大学宣布,2026 年秋季入学新生毕业需达‘AI 工作能力’指标。校方称此非教学改革,是因就业压力,AI 能力成生存技能。该要求分五个方向,各学院依学科定标准,教师支持但忧执行。
上市后的摩尔线程,重心从造芯变成建生态
上市刚满15天的摩尔线程在MDC 2025大会展示全栈技术成果,回应市场关注。其创始人强调生态是GPU行业核心,正构建MUSA生态体系,MUSA架构升级,还揭晓‘花港’架构及两款芯片技术路线。
视频模型也能推理,Sora2推理能力超过GPT-5
DeepWisdom团队研究发现视频生成模型能推理,在空间类任务上比图文模型更擅长。团队推出VR - Bench基准测试,构建客观评分体系。实验显示视频模型在空间推理有优势,相关代码和数据集已开源。
刚刚,Andrej Karpathy放出大招:开源nanochat项目,仅8000行代码100美元就能训练出一个ChatGPT
Andrej Karpathy发布nanochat项目,用8000行代码实现ChatGPT完整训练流程。在8xH100节点跑4小时、花100美元,就能有对话、写故事、答题的AI助手。项目覆盖广,含多训练步骤及评估体系。
用“因果规划”解决多智能体协作中的任务依赖难题|港科广&腾讯
港科广和腾讯研究团队提出CausalMACE方法,将因果推理机制引入开放世界多智能体系统。该方法含全局因果任务图,框架分“判断”“规划”“执行”环节,在基准任务中表现出色,已中稿EMNLP 2025 Findings。
告别“炼丹玄学”:上海AI实验室推出首个大模型数据竞技场OpenDataArena
上海人工智能实验室OpenDataLab团队推出开放数据竞技场OpenDataArena,致力于将数据质量评估从“玄学”变为“科学”。它有数据评测榜单和完整可复现的数据价值验证体系,为多类需求提供解决方案,还开源了核心工具。