评测系统」共找到 2238 篇相关文章

产品应用7

用最简单的大模型技术打造一个迁云专家有多难?

文章探讨在云迁移领域用大模型技术“复制”专家80%核心能力。分析标准化方案不足及简单RAG局限,介绍“LX0.1”AI专家助手构建,还提及分层评测、人机协同等优化,最后展望AI在云迁移的未来方向。

阿里云开发者
新闻资讯8

全球首个科研LLM竞技场上线!23款顶尖模型火拼:o3夺冠,DeepSeek第四

Ai2耶鲁NYU联合推出科研版「Chatbot Arena」——SciArena,23款顶尖大模型比拼科研任务,OpenAI o3夺冠,DeepSeek第四。该平台解决通用基准测试在科研场景‘失效’问题,但其自动评估系统猜科研人偏好远未及格。

新智元
开源动态8

GLM-5真够顶的:超24小时自己跑代码,700次工具调用、800次切上下文!

GLM - 5正式发布,把开源AI带入长任务时代。它超24小时自己跑代码,完成GBA模拟器,能力稳定。评测结果佳,在主流测试中编程能力与Claude Opus 4.5对齐,引发网友欢呼。实测还展现多种应用能力。

量子位
开源动态8

DeepSeekV3.2技术报告还是老外看得细

ChatGPT三岁生日时,DeepSeek两款开源模型DeepSeek-V3.2和DeepSeek-V3.2-Speciale引发热议。它们在智能体评测中表现出色,缩小了开源与闭源模型差距,还降低了成本,给硅谷闭源AI公司带来压力。

量子位
产品应用8

解析天花板?TextIn xParse如何为RAG打造「零损耗」知识管道

在AI应用发展中,LLM与RAG系统成核心引擎,但项目落地时模型表现常难达预期,根源在于文档解析质量。TextIn xParse能为RAG打造‘零损耗’知识管道,本文从多方面对其解析能力进行了解读。

深度学习自然语言处理
新闻资讯7

The Batch: 918 | 智能体 AI 引发投资者恐慌

投资者担忧AI系统动摇软件制造商商业根基,致标普软件与服务指数等大幅下挫。Anthropic推出多款产品加剧风波,后与部分公司合作使SaaS类股反弹,但未收复全部跌幅。AI正重塑软件市场,SaaS未死,正迈向AI原生化。

DeeplearningAI
新闻资讯7

半年销量2000万+,宇凡微如何让AI模块“飞入寻常百姓家”?

芯师爷专访宇凡微品牌部总监张雨,探讨AI模块商业化前景。宇凡微展出多款AI模块,接入豆包大模型,有自研SAS系统等优势。其通过技术、市场等层面建护城河,践行“技术平权,快速量产”理念,未来向全场景方案升级。

芯师爷
新闻资讯7

o3-pro答高难题文字游戏引围观,OpenAI前员工讽刺苹果:这都不叫推理那什么叫推理

OpenAI“最新最强版”推理模型o3 - pro引发关注。首位全职提示工程师给它设难题,它推理后答对。OpenAI前员工借此讽刺苹果。各大评测榜单显示其表现与官方有差异,苹果&SpaceX前工程师分享使用心得,肯定其表现。

量子位
算法论文8

AI Agents和Agentic AI有什么区别?

论文《AI Agents vs. Agentic AI》深入探讨AI Agent和Agentic AI的本质差异。AI Agents是集成大模型和外部工具的单体系统,适合简单任务;Agentic AI是多智能体协作新范式,适合复杂场景。还提及挑战、解决方案与未来方向。

AGI Hunt
开源动态8

这个新生图模型有点夯:4K直出的,国产的,开源的!

商汤新开源的生图模型SenseNova U1.5-Lite-Preview亮点十足,它是国产、4K直出、轻量且可指哪儿改哪儿的原生统一多模态模型。能应对复杂创作和编辑任务,技术源于NEO-Unify架构,评测成绩佳,不过还是早期预览版。

量子位