评测框架」共找到 2156 篇相关文章

推荐文章7

统一框架下的具身多模态推理:自变量机器人让AI放下海德格尔的锤子

当前先进机器人无法像人类自如用工具,现有多模态系统有局限。自变量机器人提出端到端统一架构,以统一表示学习和多任务多模态生成解锁具身多模态推理能力,实现范式转换。

机器之心
开源动态8

开源AI开发生态大洗牌:低代码平台逆袭,传统LLM框架日渐式微

第十届527蚂蚁技术日,蚂蚁对现有开源生态全面剖析,发布2025大模型开源生态全景图。分析显示开源生态有三个主导技术赛道,还总结出七大趋势,为从业者提供生态演进规律参考。

量子位
开源动态8

告别 Selenium 痛点!全新升级版 Selenium 自动化框架,斩获10.2K标星!

Selenium 编写 Web 自动化脚本痛点多,SeleniumBase 深度封装 Selenium,内置智能等待等功能,解决诸多问题。它功能强大,安装使用简单,适用于多场景,像“智能助手”让自动化测试变简单。

开源星探
推荐文章8

把 UI 生成接进流水线:基于半监督评测体系的 UI 自动化生产实践

本文来自蚂蚁集团黄兆嵩在 QCon 2026 的演讲,探讨生成式 UI 技术重塑生产方式。提出系列工程实践,包括高质量生成、LUI 场景应用及质量监控迭代,让前端生产自动运转、用户体验随需而变。

InfoQ
产品应用7

腾讯广泛使用的跨端开发框架——Kuikly在搜狗输入法中的AI Coding实践

AI 席卷开发领域,输入法团队在 Kuikly 跨端项目探索 AI 工程化方案。介绍了推进 AI 友好型工程、构建精准 AIContext 等关键层面,以灵感词库页面开发为例展示效果,还展望了未来探索方向。

腾讯技术工程
算法论文8

检索做大,生成做轻:CMU团队系统评测RAG的语料与模型权衡

CMU团队在最新ECIR接收论文中,系统评估RAG语料规模与生成模型规模替代关系。实验表明,语料扩容可让小模型追上大模型,提升主要来自证据覆盖。研究为RAG系统提供更具性价比提升路径。

机器之心
算法论文8

LLM驱动的威胁情报提取框架,从非结构化到STIX的自动化:IntelEX

为应对网络攻击,需将非结构化网络威胁情报转化为结构化情报。IntelEX是自动化攻击级威胁情报提取工具,通过LLM上下文学习等增强,能识别攻击序列并提取结构化情报为STIX格式,还可转化成Sigma,在测试中表现优异。

AI与安全
产品应用7

这一夜,中国AI彻底翻身了:DeepSeek R1让全世界刮目相看 | 深度评测

作者深度测试新DeepSeek R1,发现其代码生成能力超Claude 3.7,虽编程全面性有不足,但已处Claude 3.7与Claude 4之间。前端设计审美达Claude 4水准,部分方面略胜,有自主学习推理能力,或改变中国AI历史。

AI产品黄叔
开源动态8

斩获3K+ star,再见传统开发!这款开源AI后台开发框架让效率提升300%

ruoyi - ai是基于ruoyi - plus开发的开源AI平台,集成前沿模型,有聊天、绘画等全栈AI能力,具多模态交互和企业级部署支持,核心功能丰富,技术架构优,有实战成效,与同类有差异。

小华同学ai
产品应用8

智谱GLM-5.1深度评测:8小时连续工作,开源大模型进入"工程交付"新纪元

2026年4月8日智谱发布GLM-5.1,它是全球首个通过真实工程任务验证8小时持续工作能力的开源模型,在SWE-Bench Pro上超越GPT-5.4等登顶。该模型性价比高、技术创新多,还适配国产硬件,开源生态友好。

机器学习AI算法工程