半监督评测体系」共找到 1306 篇相关文章

新闻资讯8

同一天,百度、OpenAI双双发力高智能AI!先来实测一波原生全模态文心5.0

2025年,OpenAI凌晨更新GPT - 5系列,百度在世界大会发布文心5.0。它采用原生全模态统一建模技术,参数达2.4万亿,评测领先。实测表现佳,其技术在多方面突破,为大模型演进提供路径,助百度重回竞争中心。

机器之心
算法论文8

工行x上交大发布多智能体研究成果,通过群体智能刷新翻译新高度!

2025年多智能体系统成大模型研发新高地。工行大数据和人工智能实验室与上海交大人工智能学院推出多智能体翻译系统TACTIC,以认知翻译学为指导,在相同模型配置下提升翻译效果,在小模型下提升更明显。

深度学习自然语言处理
推荐文章7

AI Agent 的工程化被低估了

文章指出 AI 发展中工程化作用被低估,将其分为产品工程和技术工程拆解构建 AI Agent 体系。产品工程涵盖需求建模、UI/UX 设计等模块;技术工程涉及架构模块化、流量控制等方面,还提及 Spring AI Alibaba 等工具。

阿里云开发者
产品应用7

用最简单的大模型技术打造一个迁云专家有多难?

文章探讨在云迁移领域用大模型技术“复制”专家80%核心能力。分析标准化方案不足及简单RAG局限,介绍“LX0.1”AI专家助手构建,还提及分层评测、人机协同等优化,最后展望AI在云迁移的未来方向。

阿里云开发者
新闻资讯7

全员 token-maxxing,一场没人敢停的军备竞赛|五源孟醒 AI 观察

2026年3月底,五源资本合伙人孟醒赴硅谷考察,回国后分享一手观察。当前AI迭代极快,硅谷陷入全员token - maxxing军备竞赛,xAI团队雪崩,工程师和研究员焦虑,英伟达掌控算力,估值体系重写,还出现安全危机。

五源资本 5Y Capital
开源动态8

GLM-5真够顶的:超24小时自己跑代码,700次工具调用、800次切上下文!

GLM - 5正式发布,把开源AI带入长任务时代。它超24小时自己跑代码,完成GBA模拟器,能力稳定。评测结果佳,在主流测试中编程能力与Claude Opus 4.5对齐,引发网友欢呼。实测还展现多种应用能力。

量子位
开源动态8

DeepSeekV3.2技术报告还是老外看得细

ChatGPT三岁生日时,DeepSeek两款开源模型DeepSeek-V3.2和DeepSeek-V3.2-Speciale引发热议。它们在智能体评测中表现出色,缩小了开源与闭源模型差距,还降低了成本,给硅谷闭源AI公司带来压力。

量子位
产品应用8

获NVIDIA致谢:悟空Agent的实践、复盘与迭代

本文以悟空Agent获NVIDIA致谢为切入点,介绍多智能体架构闭环及实战挑战,如上下文断流、调度失衡。还阐述架构设计、迭代优化、数据飞轮体系,指出AI infra存在安全隐患,强调安全融入业务的重要性。

腾讯技术工程
新闻资讯7

o3-pro答高难题文字游戏引围观,OpenAI前员工讽刺苹果:这都不叫推理那什么叫推理

OpenAI“最新最强版”推理模型o3 - pro引发关注。首位全职提示工程师给它设难题,它推理后答对。OpenAI前员工借此讽刺苹果。各大评测榜单显示其表现与官方有差异,苹果&SpaceX前工程师分享使用心得,肯定其表现。

量子位
开源动态8

这个新生图模型有点夯:4K直出的,国产的,开源的!

商汤新开源的生图模型SenseNova U1.5-Lite-Preview亮点十足,它是国产、4K直出、轻量且可指哪儿改哪儿的原生统一多模态模型。能应对复杂创作和编辑任务,技术源于NEO-Unify架构,评测成绩佳,不过还是早期预览版。

量子位