「大模型评估」共找到 9370 篇相关文章
AI编程冲刺“DeepSeek时刻”:00后团队用国产模型一键直出复杂应用,效果超越Claude Code
云端Agent有新进展,重新定义AI编程范式。Vinsoo上新Beta 3.0版本,仅用国产大模型就超越一众流行AI编程产品。它解决了4个核心技术问题,还带来三重云端AI Agent新体验,其研发团队由00后主导。
开源模型终于有了自己的 Opus 时刻
智谱深夜发布的新一代旗舰模型 GLM - 5,此前以匿名模型 Pony Alpha 被开发者热测。2026 年编程大模型风向转变,GLM - 5 参数提升,测试成绩优异,实测能完成复杂工程任务,适配国产算力平台。
阿里Qwen3.5小模型发布:0.8B参数就能处理视频,边缘AI时代真的来了
阿里通义千问发布Qwen3.5系列四款小模型,采用Gated DeltaNet混合注意力机制。有原生多模态设计,解决“内存墙”问题。在多基准测试中表现出色,开发者反响好,但也存在幻觉级联、调试局限等问题。
神秘霸榜模型现真身:小米MiMo-V2 Pro,国内首个万亿参数+1M上下文,为Agent而生!
小米全新一代面向 Agent 的大模型家族官宣,包括 MiMo-V2-Pro Preview、MiMo-V2-Omni 和 MiMo-V2-TTS。MiMo-V2-Pro 性能优异,在多场景实测表现出色,技术有创新,API 开放且定价低,已融入小米多业务与生态。
红杉中国xbench全球首发,AI智能体真实战力揭榜!
红杉中国推出全新AI基准测试工具xbench及相关论文,采用双轨评估体系和长青评估机制,首期发布两个核心评估集并综合排名,还提出垂类评测方法论。它能追踪模型能力与实际场景价值,解决现有评估难题。
R-HORIZON:长程推理时代来临,复旦NLP&美团LongCat重磅发布LRMs能力边界探测新范式
复旦大学与美团LongCat Team联合推出R - HORIZON,它是首个系统性评估与增强LRMs长链推理能力的方法与基准。提出Query Composition方法构建评测基准和训练数据,评测发现主流模型长链推理性能断崖式下降,还分析出三大瓶颈,训练后模型性能双重提升。
为什么 LLM 搞不定复杂任务?ReAct 与 Reflexion 技术综述
文章指出大语言模型处理复杂任务存在事实幻觉、缺乏实时信息等问题。介绍ReAct将推理和行动结合,及Reflexion在其基础上添加评估反思机制,探讨两者结合优势,还提及未来发展方向。
首个地球科学智能体Earth-Agent来了,解锁地球观测数据分析新范式
上海人工智能实验室与中山大学联合研发的 Earth - Agent 解决了多模态大语言模型用于地球科学研究的痛点。它将领域知识工具封装化,利用 LLM 智能规划调度。经 Earth - Bench 评估,其在多方面表现出色,未来发展前景广阔。
RecGPT-阿里的LLM推荐系统落地方案
文章介绍阿里RecGPT推荐系统落地方案,包括召回和推荐可解释性两方向。召回采用三塔结构,通过挖掘用户兴趣生成商品标签提升召回多样性。还提及行为序列压缩、推荐归因等,以及大模型微调和评估方法。
这次,LLM黑盒被LLM打开了~
随着大语言模型(LLM)能力提升,其内部机制更不透明。概念描述新范式用另一个 LLM 自动生成自然语言解释。介绍了描述对象、生成方法、评估指标,还提及社区关注方向,指出结合多种手段才能把解释变知识。