「协同测试」共找到 2084 篇相关文章
担心被曝“于谦门”,57岁的于谦到底用龙虾做了什么?
于谦视频播客《多新鲜呐》最新一期,本质是“AI产品用户体验公开测试”。于谦作为测试员,关注点在结果、省事、风险等,节目把技术叙事换成生活叙事,帮AI面向大众转译。
刚刚,Grok 4发布,「人类最后的考试」中拿下50.7%,碾压所有对手,游戏结束?
Grok 4发布并对X Premium+订阅者开放。它是领先的AI模型,人工智能指数超对手,全方位性能爆表,还具备实用功能。在「人类最后的考试」拿下50.7%,显示AI智能增长无上限。
苹果憋一年终超同参数 Qwen 2.5?三行代码即可接入 Apple Intelligence,自曝如何做推理
今年 WWDC 大会上,苹果推出专为增强 Apple Intelligence 功能的语言基座模型,含约 3B 参数紧凑型与基于服务器的混合专家模型。经优化可在苹果芯片高效运行,改进工具使用与推理能力,评测显示设备端模型表现优。
从WAIC上爆火的功夫机器人,看到这家央企的具身智能「真功夫」
今年4月“功夫boy”机器人出圈,3个月后的WAIC上它全新升级。其背后是中国电信人工智能研究院(TeleAI),由李学龙教授带领。他们技术栈全面,在硬件、软件、数据等方面全栈自研,还布局智传网,未来发展潜力大。
AI"学霸"也解不出高中题?耶鲁、复旦发布MMSciBench,揭示AI理科推理能力短板
耶鲁、复旦等推出MMSciBench评测基准,揭示主流模型复杂科学推理短板。它有高质量数据、多模态多题型测试和精细知识分类体系。测试发现模型图文融合及推理能力弱,英文推理或效果更好。
从「降本增效」到「智能中枢」:低代码在 AI 浪潮中的价值重估——专访金现代赵鹏程谈企业数字化转型新引擎
LowCode低码时代专访金现代轻骑兵低代码PaaS平台产品经理赵鹏程,探讨AI与低代码融合对软件工程范式革新和企业数字化转型的影响。介绍了低代码价值重估、应对新兴技术、企业实践、跨越工程化鸿沟路径、核心竞争力及未来展望等内容。
GPT-5.2发布,真正的牛马打工人专属AI来了。
OpenAI十周年凌晨2点发布GPT - 5.2。它在部分跑分上提升不大,但在ARC - AGI - 2和GDPval评测集表现亮眼,上下文处理能力也大幅加强。将开放给会员使用,价格比5.1贵。
模型汤新做法!Meta|提出“类别专家汤”:SoCE,大幅提升模型性能,刷新SoTA!
大语言模型领域,提升性能常需高算力、大量数据和长时间训练。Meta提出新型模型汤技术SoCE,通过分析类别相关性操纵模型权重,在BFCL上刷新SOTA记录,为开源社区指明低成本进化之路。
如何破解内容安全“不可能三角”?快手王东旭:把组织从“固态”变成“液态”
快手内容安全团队负责人王东旭在AICon大会拆解“人机协同”破解内容安全“不可能三角”。他提出组织从“固态”转向“液态”,构建“AI合成旅”,还阐述产运研等岗位职能跃迁及协同模式升级,强调速度是护城河。
美团LongCat扎扎实实做了件难事:LLM数学新天花板AMO-Bench
美团LongCat团队联合高校推出AMO - Bench,用50道原创奥赛级难题评估LLM数学能力。它解决现有基准测试痛点,经四重把关构建,测试显示顶级模型表现不佳,也揭示模型提升空间大。