「标准化评测」共找到 702 篇相关文章
π0引用的中国团队,又出手了:世界仿真器新作发布
Current Robotics团队发布交互式世界仿真器CurrentWorld - 0,创始人祝毅晨履历亮眼。该仿真器能跨本体、多视角、力 - 触觉预测,可用于评测机器人,还能让人类接管以探索不同动作结果。
刚刚,Anthropic 又出新货:Claude Opus 4.1 发布,代码、推理能力再升级
Anthropic发布Claude Opus 4.1,是对Opus 4的小升级,提升智能体任务、代码处理和推理能力。付费Claude用户等已可用,价格不变。在编程评测表现佳,获多方好评,官方建议升级。
狂揽22.6k星!这个开源工具让你一键调用100+大模型,开发效率直接起飞!
LiteLLM是BerriAI团队开发的开源工具,通过标准化OpenAI格式API接口,能无缝调用100+主流大语言模型。有核心功能亮点,适用于多场景,还给出上手步骤,并与同类项目对比。
OmniInsert:全新无掩码视频插入技术
基于扩散模型的视频插入技术发展快,但以往方法有局限。字节提出InsertPipe和OmniInsert,解决数据不足等难题。OmniInsert设计巧妙,还建立评测平台InsertBench,虽有小问题,但推理快,可加速优化。
你的 Harness 工作流真的在进步吗?我们用一场考试撕掉了遮羞布
文章指出Harness工作流常靠‘主观vibes’驱动,缺乏有效评价体系。为此推出Harness Eval评测系统,包含出题、答题、改卷等环节,形成闭环,帮助工作流持续改进,还能提升整体通过率。
智元机器人发布并开源首个机器人动作序列驱动的世界模型
近日,智元机器人发布并开源全球首个基于机器人动作序列驱动的具身世界模型 EVAC 及具身世界模型评测基准 EWMBench,构建全新开发范式,打破具身智能演进制约。
打造图像编辑领域的ImageNet?苹果用Nano Banana开源了一个超大数据集
苹果研究团队提出Pico - Banana - 400K数据集,基于Nano - Banana在OpenImages实拍照片生成编辑对。其系统化设计保证质量与多样性,还构建自我编辑评估流程,为图像编辑模型训练评测奠定基础。
openJiuwen社区开源新招:重磅发布JiuwenSwarm,拉开群体智能“养蜂”序幕
openJiuwen社区开源蜂群智能体JiuwenSwarm,落地Coordination Engineering范式。它有全栈技术体系,支持人以HOTS和HITS模式参与协同,实战效果佳,且在评测中表现亮眼,全套能力开源。
Anthropic 为什么推出 Skills?它会革谁的命!
近期Claude Code出圈,开发者基于其构建应用。Anthropic 作为先驱,在 MCP 后推出 Skills,旨在解决现有技术架构痛点,它是标准化 SOP,有分层设计优势,还推荐了 skill0.atypica.ai 平台。
让模型“看视频写网页”,GPT-5仅得36.35分!上海AI Lab联合发布首个video2code基准
上海人工智能实验室等机构提出IWR - Bench评测基准,从“image - to - code”迈向“video - to - code”,对28个主流模型测试,最佳模型GPT - 5仅36.35分,指出当前模型短板,为研究指明方向。