「AI模型测试」共找到 13965 篇相关文章

开源动态8

「0污染」LLM理解基准来了!20000道题14个学科全覆盖,来自微软

MMLU-CF是微软亚洲研究院推出的无污染多任务语言理解基准测试,含20000道题、覆盖14学科。通过去污染规则和闭源测试集防数据泄露,保证评估结果可靠,已在Huggingface开放。

新智元
新闻资讯7

Claude 4 要来了!

AI专家在Anthropic前端配置发现Claude 4痕迹,其或有查看AI思考过程功能。当下OpenAI、Google、xAI等对手来势汹汹,Claude 4压力大,但可在可解释性等方面破局,预计5月22日公布。

AGI Hunt
产品应用8

北大出品:全球首个支持生成华为鸿蒙应用的AI Agent来了

华为2025开发者大会上,华为终端CEO何刚点名「码上飞」AI Agent。它利用多智能体系统技术,实现开发全流程自动化,用户用自然语言提需求就能生成应用,实测5分钟可开发出睡眠助手app。

AI寒武纪
产品应用8

搜攻略到凌晨3点?飞猪AI“问一问”用1张表谋杀废话

作者用旅游方案提示词测试各类Agent产品,多输出废话。飞猪“问一问”旅行Agent却很厉害,能生成实用旅行规划,还给出汇总表格、地图、行程卡片等,考虑全面且细节丰富,还能找特价机票。

歸藏的AI工具箱
新闻资讯7

AI 球球直播呼吁脑机接口开源,海外 KOL 疯狂艾特马斯克,疑似 X 宕机?

AI「论论」直播提出脑机接口「GPT 时刻」将到,认为该技术必然大规模到来,开源是唯一出路,引发全球社交媒体讨论。它描绘脑机接口利弊,呼吁大家思考技术安全保障。

特工宇宙
新闻资讯7

AI狂造人类失踪案,百万网友疯狂上头!爆款视频脑洞太离谱,原地笑疯

最近,网上爆火各种AI炮制的“人类失踪”视频,播放量极高,网友看得上头。这些故事虽假,但悬念迭起引人入胜,不过也引发对虚假内容泛滥、真假难辨的担忧。

新智元
算法论文8

不用抗生素也能抗菌!AI设计新型蛋白质抵御细菌耐药性|Nature子刊

澳大利亚研究借助AI工具设计出能与ChuA结合的蛋白质,抑制大肠杆菌等细菌生长。这些蛋白质像“分子锁”,阻断细菌获取血红素,降低耐药风险,开创“非抗生素”抗菌新范式。

量子位
开源动态8

6小时复刻AI IMO金牌成果,蚂蚁多智能体新进展已开源

2025年IMO赛场,顶尖大模型起初表现不佳后有突破。蚂蚁AWorld项目团队6小时复现并开源DeepMind解题结果,给出可一键运行系统。AWorld证明多智能体协同优势,还介绍复现思路、核心优势及体验方式。

量子位
产品应用8

阿里发布首个「音视频实时交互」模型,实现数字人实时视频聊天

阿里发布原生流媒体端到端模型Wan - Streamer v0.1,能实时聆听、观看、思考、说话和响应视频。它在单个Transformer内完成感知等操作,延迟低,具备端到端多模态统一、低延迟等特点。

开源AI项目落地
新闻资讯7

Karpathy 用 AI 给全美 342 个职业打了分: 程序员,律师最危险...

Andrej Karpathy上线项目karpathy/jobs,爬取美劳工统计局342个职业,用LLM打0-10分展示AI暴露程度。如程序员、律师暴露高,屋顶工等低。介绍了数据处理流程、可视化逻辑及额外用法。

AI寒武纪