「评估框架」共找到 2212 篇相关文章
中科院首提「AI哲学」,万字解读:为自身立命,为AI立心
中科院吴怀宇教授首次系统性提出「AI哲学」体系,以「感智境行」为核心架构,探讨智能本质、人机边界等,为人类应对AI冲击提供认知框架,也为AI赋予意识根基,涉及多学科,具多方面价值。
解放军总医院联合南大、吉大等机构,共同提出首个「脊柱诊疗大模型」SpineGPT
解放军总医院联合多机构研发首个脊柱诊疗大模型 SpineGPT。研究指出通用 LVLM 有‘认知鸿沟’,团队构建 SpineMed 生态系统,含 SpineMed - 450K 数据集与 SpineBench 评估基准,SpineGPT 表现超越开源模型。
仅需10%思维链标注,等同全量性能!中科院发布推理监督新范式
中科院计算所团队提出新框架PARO,让模型学习固定推理模式自动生成思维链,只需标注1/10数据就能达全量人工标注性能,适合规则清晰领域,为推理监督提供新思路。
让VLM学会「心中有世界」:VAGEN用多轮RL把视觉智能变成「世界模型」推理机器
当前VLM智能体面对复杂视觉任务表现不佳,美国西北大学等机构联合研究成果VAGEN,提出创新强化学习框架,奖励正确思考过程,让VLM在行动前构建内部世界模型,效果超多款闭源大模型。
Jina官方MCP三板斧:搜、读、筛
Jina官方发布MCP服务器,将核心能力封装成LLM工具集。介绍工具功能、连接使用方法,给出问题排查方案,通过案例展示搭建工作流效果,评估不同模型,指出Agent瓶颈及MCP开放生态价值。
AI行业的底牌已经亮完了,模型能力趋同后,拼什么?
Databricks MVP Adi Polak分析AI人才需求,指出能搭建评估管道等的工程师是硬通货。前沿模型架构趋同,行业从技术竞赛转向生态战争,比拼产品和用户理解能力,还为转型工程师给出建议。
从Debugger到Developer : 低代码时代新基准NoCode-bench,SWE-Bench作者力荐
浙江大学牵头联合多机构推出全新评估基准NoCode - bench,直面自然语言驱动功能添加任务,发现当前最佳LLM成功率仅两成。它构建严谨,任务挑战大,指明AI软件开发改进方向,且已开源。
The Batch:834 | 更一致的人物与风格
德国 Black Forest Labs 的 FLUX.1 Kontext 系列文本生成图像模型,可可控编辑图像。有 max、pro 和 dev 版本,功能含角色一致性和图像编辑,在测试中表现优,公司计划公开专有评估基准。
国产多模态Agent拿下医学分割SOTA!不用改模型、不加token | 浙大&上海AI Lab
现有医学多模态大模型在分割生物医学图像时存在瓶颈,浙大蔡钰祥教授、上海AI Lab江彦开等人提出IBISAgent框架,将分割定义为多步视觉决策过程,实验显示其在多数据集上大幅领先对比方法。
迈向可编程观测:在GPU Kernel中构建类eBPF风格的性能探针
文章从CUDA基础讲起,以矩阵乘法为例介绍性能调优,再到PTX汇编知识,最后引入Neutrino框架构建可编程GPU性能探针。展示了GPU Kernel性能分析从宏观到微观的技术演进,提供新分析视角。