评测体系」共找到 1162 篇相关文章

开源动态8

耶鲁等团队联合发布首个虚拟细胞Agent,可自动设计出先进的模型

耶鲁等团队发布首个多智能体系统CellForge,可自动化设计虚拟细胞模型。它能输出模型架构和代码,有跨模态能力,性能超多个领域代表性模型,可降低科研门槛,加速药物研发。

力学与人工智能
产品应用7

八爪鱼微电子:打造感算一体的智能识别生态

八爪鱼微电子成立于2019年,是国内智能门锁芯片与模组领域领先企业。它构建‘感算一体’底层技术体系,还通过标准共建、创新平台构建等推进生态建设,欲以技术与生态驱动行业创新。

芯师爷
开源动态8

o3 Gemini 都翻车?首个可验证长链 GUI 数据集 VeriGUI 重磅开源,探索通用 Agent 能力边界

GUI 智能体发展遇瓶颈,现有数据集难评估其长时程规划能力。2077AI 开源基金会牵头构建的 VeriGUI 应运而生,有长链复杂性与子任务级可验证性特征,论文登 Hugging Face 月榜第三,还证明现有模型瓶颈。

AI科技评论
产品应用7

钉钉上跑出的第一个行业专属大模型落地:准确率超 90% 的妇科专业大模型

近日,壹生检康在钉钉企业专属 AI 平台训练出“豆蔻妇科大模型”,准确率达 90.2%。钉钉构建支持体系助企业构建大模型,后续还将帮伙伴构建模型和智能体,服务中小企业。

AI前线
8

豆包 AI 编程:一句话写赛博鱼缸,动嘴皮改富士滤镜

豆包发布全新模型 1.6 后,AI 编程更新,基于此模型在评测集位列第一梯队。它实现低门槛+可用性,能一句话生成网站、工具,还可可视化编辑,目标是让普通人能做产品。

刘言飞语
新闻资讯8

从刮胡子机器人到双臂神技!这家具身独角兽引爆亿级美元融资热潮

具身智能大热,Generalist AI展示「拂晓」仿人自适应机器人完成高难度任务。日前,非夕科技宣布完成C轮亿级美元融资。该公司由前DeepMind科学家创立,获英伟达投资,其机器人在多领域有应用。

新智元
开源动态8

全球首个历史基准!普林复旦打造AI历史助手,AI破圈人文学科

普林斯顿大学AI实验室与复旦大学历史学系联手推出全球首个历史领域评测基准HistBench及AI助手HistAgent。HistBench含414道题,能检验AI深度认知能力;HistAgent集成多种工具,在测试中表现优异。

新智元
算法论文8

73%人类认同率!Video-Bench实现视频质量精准打分

上海交大等团队提出视频评估框架Video - Bench,让多模态大模型‘像人一样评判视频’。它构建双维度评估框架,引入链式查询和少样本评分技术,与人类判断73%高相关,为视频生成模型优化提供标尺。

深度学习自然语言处理
新闻资讯8

吴恩达评Agent现状:MCP尚处“蛮荒”,单Agent跑通已是“奇迹”,A2A协作堪称“双重奇迹”

吴恩达与LangChain联合创始人对话,评Agent现状。他认为MCP尚处‘蛮荒’,单Agent跑通不易,A2A协作更难。还谈了Agentic架构、AI系统构建、工具使用、语音技术等,给出创业建议。

InfoQ
开源动态8

搜索智能体也需要「操作系统」:SearchOS 开源多智能体协作框架

人大和蚂蚁的 SearchOS 研究,给出搜索智能体在长程任务中问题的答案。它借鉴数据库理念,做了多项核心设计,在开放信息检索基准评测领先,已提供多种使用方式,值得长程调研尝试。

机器之心