测试评估集」共找到 2678 篇相关文章

算法论文8

颜水成领衔,给AI分段位!超100款多模态模型,无人达到L5

十所顶尖高校联合发布General - Level评估框架和General - Bench基准数据,用五级分类制明确多模态通才模型能力标准。评估超100款模型,发现多数在L2 - L3,无L5模型,揭示当前模型不足。

新智元
算法论文8

谷歌助力神经科学飞跃,破解斑马鱼全脑活动密码

谷歌等机构科学家联合发布开创性研究成果ZAPBench,这是预测斑马鱼全脑活动的基准测试平台。它含超70000个神经元4D光片显微镜记录,设计多种刺激条件采数据,有特定基准测试任务和评估指标。

AIGC开放社区
开源动态8

我们离Coding领域的「AGI时刻」还有多远?字节跳动Seed发布NL2Repo-Bench仓库级长程代码生成基准

在AI编程领域,大家认为Coding领域的AGI似乎可以实现,然而真正的项目开发要求更高。近日,字节跳动Seed等联合发布首个评估编码智能体端到端仓库生成能力的基准测试NL2Repo - Bench,还介绍了其构建、评估等情况。

机器之心
算法论文7

Veo何止生成视频:DeepMind正在用它模拟整个机器人世界

通用型机器人策略发展带来挑战,传统评估方法有局限,前沿视频模型虽有潜力但面临困难。Google DeepMind团队提出基于Veo的机器人策略评估系统,经实验验证有效,展示了视频仿真评估的可行路径。

机器之心
新闻资讯7

ChatGPT正测试神秘功能

ChatGPT正测试名为“Study Together”的新功能,已出现在部分订阅用户工具列表。它或更多提问题让用户回答,似回应谷歌LearnLM,还可能支持多人学习小组模式,有望减少其被滥用可能。

AIGC开放社区
新闻资讯7

ChatGPT正测试神秘功能

ChatGPT正测试“Study Together”新功能,已出现在部分订阅用户工具列表。它或更多提问题让用户答,类似对谷歌LearnLM的回应,有望发挥积极教育作用,减少被滥用可能,也可能支持多人学习小组模式。

AIGC开放社区
新闻资讯7

Cloudflare 发布公开测试版 Containers

Cloudflare宣布新的Containers服务发布公开测试版,可让开发者在其全球网络运行容器。该服务与Workers深度成,能运行资源密型应用等。虽有功能受限,但Reddit反馈积极,后续还有改进计划。

InfoQ
新闻资讯7

OpenAI神秘项目曝光:cderGPT,用AI加速药物评估

OpenAI神秘项目cderGPT曝光,用于加速药物评估。FDA局长指出新药上市耗时长且未实现技术现代化,不过目前该项目细节未透露,有人支持用AI辅助审查,也有人担心其可靠性。

量子位
产品应用8

模型测试不再跳来跳去,VS Code + Hugging Face = 真香

Hugging Face 发布新功能,让开发者在 VS Code 的 GitHub Copilot Chat 中直接接入 Inference Providers,可调用 Kimi K2 等开源大模型测试,无需频繁切换平台。该功能有统一 API 等优势,定价门槛低。

InfoQ
开源动态7

Void IDE,Cursor 的开源替代品,发布测试

新的开源AI代码编辑器Void IDE发布测试版,定位为Cursor等闭源编辑器的免费隐私替代方案。它是VS Code分支,能利用多种大模型,提供AI功能,开发者对其开源和隐私立场感兴趣。

AI前线