代码评估数据集」共找到 4427 篇相关文章

推荐文章8

一文搞懂 Agents 评测丨Anthropic 最新万字长文

传统模型评测方法难评估 Agent 系统,Anthropic 摸索出有效评测设计方法。文章介绍评测结构、意义、方法,涵盖编程、对话等 Agent 评测,还给出打造评测路线图及与其他方法结合的建议。

特工宇宙
算法论文8

RL是「点金石」还是「挖掘机」?CMU 用可控实验给出答案

卡耐基梅隆大学研究者构建基于GSM - Infinite的可控合成数据框架,分析预训练、中期训练和RL对模型推理泛化能力的影响,调和了RL有效性的不同观点,为改进训练策略提供基础。

机器之心
开源动态8

谷歌推出 LLM-Evalkit,为提示词工程带来秩序与可衡量性

谷歌推出基于 Vertex AI SDK 的开源框架 LLM - Evalkit,让大语言模型提示词工程更有序可衡量。它整合实验、测试等环节,与谷歌云工作流集成,有无代码界面,已在 GitHub 发布。

AI前线
新闻资讯7

ChatGPT惊现“零点击攻击”,API密钥被轻松泄露,OpenAI暂未解决

ChatGPT存在“零点击攻击”安全问题,攻击者可通过向第三方应用文档注入恶意提示,窃取用户敏感数据和API密钥。OpenAI虽采取防范措施,但攻击者仍能绕过。专家为企业提出防范建议。

量子位
7

28岁辍学生掌舵Meta超级AI!小扎掷千亿,与奥特曼密谋,新「王」登顶

28岁的Alexandr Wang 19岁辍学,24岁成亿万富翁,现加盟Meta负责「超级智能」部门。他接受专访谈前沿思考,如智能体经济将至、人类成管理者、数据是瓶颈等,其理念有争议。

新智元
新闻资讯7

刚刚,SpaceX、英伟达宣布:AI数据中心要上天了

SpaceX与英伟达合作设计Starmind AI1卫星计算载荷,每颗卫星搭载NVIDIA GPU和CPU,将数据中心算力部署太空,该设计也用于地面数据中心。但项目投入大,还面临管理集群等难题。

机器之心
推荐文章8

如何正确Vibe Coding?这是来自Anthropic编程智能体负责人的大师课

Anthropic研究员Erik Schluntz分享Vibe Coding经验。他认为AI能力指数级增长,开发者应接纳大模型生成系统,还提出聚焦‘叶子节点’、做好产品经理等策略,并介绍22000行代码合并案例及实战问答。

机器之心
新闻资讯7

稚晖君家智元没参展机器人大会,合着是人家自己办(doge)

这是智元机器人首届合作伙伴大会现场画面。前段时间世界机器人大会没智元身影,原来它有自己的大会。现场机器人表现多样,有比心、穿梭、自主讲解等,还有真机数据采集、流水线分拣等工作场景。

量子位
产品应用7

Figma 如何使用 AI 来支持而不是取代设计师

Figma 在设计平台集成 AI,有自动命名层等功能,能将文本提示等转换为生产就绪代码。其 AI 功能基于早期基础设施,关键在于 Dev Mode 和 MCP 服务器,确保设计师掌控输出,降低制作软件障碍。

AI前线
新闻资讯7

刚刚,OpenAI发布自主编码代理Codex,程序员的工作将被彻底颠覆?

OpenAI发布自主编码代理Codex,它能独立完成编程任务。与其他工具不同,它是面向任务的,允许并行工作。虽经强化学习微调,代码有“品味”,但有局限,如后续请求处理不佳,未完全集成工程环境。

AGI Hunt