「AI测试集」共找到 10746 篇相关文章
智谱AI、清华开源新视觉大模型:刷新41项纪录,同级别最强
智谱AI与清华联合开源GLM - 4.5V视觉大模型,它基于GLM - 4.5 - Air开发,架构独特。在42项主流测试中创41项新纪录,多领域表现超Qwen2.5 - VL等模型,还采用新训练策略。
GPT-5仅23.3%,全球AI集体挂科!地狱级编程考试,夺金神话破灭
最新基准测试SWE-Bench Pro评估AI编程智能体,直面真实企业级工程任务。顶尖模型几乎溃败,GPT - 5仅23.3%。该测试解决现有基准数据污染、任务简单问题,能成未来LLM编码能力标尺。
AI 终于能"玩手机"了:Mobile MCP 让大模型直接操控你的 iOS 和 Android
Mobile MCP 是开源 MCP Server,让支持 MCP 协议的 AI 客户端操控 iOS 和 Android 设备,通过自然语言指令完成操作,解锁自动化测试等场景,但成功率有待提升,目前更适合探索性测试等。
直播预约 | Recursive Self-Improvement:当AI开始进化AI
2026年AI已能在无人类干预下自我进化。6月24日19:00 - 21:00,机器之心联合黄大年茶思屋举办直播,汇聚仉尚航等专家,呈现“AI如何自我超越”的技术路线与未来图景。
全球AI失业大逃杀:25年已裁94000人!微软高管:被裁可用AI管理情绪
2025年才过一半,全美科技行业已有94000人被裁,微软又裁9000人,Xbox高管竟建议被裁员工用AI疗伤。各科技公司为配合AI战略调整劳动力结构,多岗位面临被AI取代风险。
让 AI 自己做增长:基于OPC和Harness思想的自主增长系统探索
文章围绕让AI自主做增长,基于OPC和Harness思想构建自主增长系统展开。介绍了系统背景、做法、多Agent架构落地方案,还提及踩坑问题、解决方案及对未来的思考,如完善数据集、探索OPC + AI Agent模式。
马斯克Grok-4卖货创收碾压GPT-5!AI卖货排行榜曝光,AGI的尽头是卖薯片?
新智元报道,「Vending Bench」榜单让大模型经营自动售货机一较高下。Grok - 4卖货能力超GPT - 5,销量约高2倍,营收增31%。此测试揭示AI长周期决策挑战,引发AGI定义讨论。
李建忠对话 KK 凯文.凯利:通用智能是个伪命题,AI 不应该模仿人类 | AI 进化论
CSDN策划的“AI进化论”直播栏目,超50万人观看。李建忠与凯文·凯利跨洋对谈,涉及人机交互、智能路线等十大话题。凯利观点犀利,如认为通用智能是伪命题,AI创造力是“异人”的,科技巨头难在AI时代保持主导等。
Sora 2数手指翻车,奥特曼成第一批「受害者」,被AI玩成最惨打工人
Sora 2虽强大,但数手指测试翻车,模拟场景也有瑕疵。奥特曼成其首批“受害者”,AI生成视频将他玩坏。同时,OpenAI研究员对Sora应用发布存担忧,而奥特曼解释资金投入原因。
九成以上模型止步白银段位,只有3个铂金!通用AI下半场评测标准来了
OpenAI研究员姚顺雨提出AI发展步入新阶段,下半场关键在评估模型真实智能。新加坡国立大学等团队提出“通才智能”评测框架,剖析多模态大模型短板,推出五级评估体系和测试集,测试结果暴露模型弱点,引发社区积极反响。