评测平台」共找到 1912 篇相关文章

新闻资讯8

Claude Code把自己的提示词删掉80%,我照着砍了自己的60%

Anthropic将Claude Code系统提示词删减超80%,编码评测表现无明显下降。文章阐述删减背后判断,给出六条变化策略、四类文件写法及两条方法论,还介绍实施步骤,作者按此精简提示词约60%。

花叔
开源动态8

给GUI Agent装上「世界模型」:阿里通义用混合数据+统一思维链,让模型学会预判屏幕变化

伴随多模态大模型发展,GUI Agent成人机交互新范式,但构建高可用、跨平台的GUI Agent面临诸多挑战。阿里通义实验室开源Mobile - Agent - v3.5框架及GUI - Owl - 1.5模型家族,解决了相关技术壁垒。

量子位
新闻资讯7

神秘模型「Pony Alpha」引外网热议,它会是国产大模型中的谁?

近日,全球模型服务平台OpenRouter上搜索第一的神秘模型「Pony Alpha」引外网热议,它是新一代通用大模型,在多方面表现突出且可免费使用。网友、AI猜测其身份众说纷纭,已有人用它做出惊艳案例。

机器之心
产品应用8

AI 医疗还在比进度,百川已在比高度

近一年来,AI医疗进入新阶段,众多企业和资本涌入。但当前主流医疗大模型有局限,落地难。百川Baichuan - M3聚焦医疗决策过程建模,三项关键评测达全球最优,或代表AI医疗重要转向。

AI科技评论
推荐文章7

AICon上海演讲精华回顾:《GMI Cloud 全球化高性能分布式推理服务构建实践》

AICon2025上海站,GMI Cloud资深架构师Frank Lee分享《GMI Cloud全球化高性能分布式推理服务构建实践》,介绍其推理平台,拆解扩缩容等能力,分享架构设计、部署及优化实践,揭秘推理提效关键路径。

InfoQ
推荐文章7

深入解析|Cursor编程实践经验分享

文章结合近两个月实践,分享Cursor编程经验,探讨其适用场景与问题。介绍使用方法,如标准Prompt、Rules等,还提及MCP工具及Cursor不足,对比DeepResearch等平台,最后介绍AutoGPT、Claude4.0等技术。

阿里云开发者
产品应用7

华为昇腾推理对决:开源vLLM vs 官方MindIE,数据说话「Qwen与DeepSeek推理实测」

文章围绕华为昇腾推理,对比开源vLLM与官方MindIE。借助GPUStack平台测试Qwen与DeepSeek模型,分析不同场景性能。指出vLLM和MindIE各有优势,还强调构建国产AI推理生态需多要素,鼓励开源协作。

AI寒武纪
推荐文章7

大模型微调知识与实践分享

文章详细介绍大型语言模型(LLM)微调知识与实践,包括模型结构、参数量等知识,以及Prompt工程、数据构造、LoRA微调等技术点。还给出微调实践流程,介绍相关平台和框架,如星云、TuningFactory等。

阿里云开发者
算法论文8

打破学科壁垒!400篇参考文献重磅综述,统一调查「人脑×Agent」记忆系统

哈工大等多机构联合发布重磅综述,打破认知神经科学与人工智能学科壁垒,统一审视人脑与 Agent 记忆系统。文中剖析记忆定义、作用、分类、存储、管理等,还提及评测、安全问题及未来多模态记忆、技能迁移方向。

机器之心
新闻资讯8

英伟达XR-AI Scientist亮相:丛乐、王梦迪团队把“AI科学家”送进实验室|甲子光年

10月底英伟达上线NVIDIA XR - AI平台,丛乐、王梦迪团队联合英伟达等推进其在实验室科学融合应用,涉及LabOS和CRISPR - GPT两项技术突破,还推出LSV Benchmark标准及排行榜,有望改变XR现状。

甲子光年