路由评测」共找到 697 篇相关文章

算法论文8

Coding Agent 自主解题很强,但用户改一行代码就"翻车"?自所团队提出 SWE-Touch 揭示共享工作空间下的能力缺口

当前基于大模型的Coding Agent是热门研究方向,现有评测多假设其独占代码仓库。中科院自动化所团队构建SWE - Touch框架,对9个前沿模型测试,发现用户干预下模型性能下降、排名洗牌。

深度学习自然语言处理
算法论文8

长程任务飙升98%,斯坦福Skill原生LLM来了

普林斯顿、CMU、斯坦福、牛津等提出Skill-Native大模型,提出Skill Entropy度量技能切换难度,搭建Skill²-Bench评测,还将熵用作训练信号提出Skill-Entropy RL,提升多模型准确率,且技能熵可复用。

PaperAgent
开源动态8

真可用!美团数字人模型开源,MV、电商等统统拿下

美团开源数字人视频生成框架 LongCat - Video - Avatar 1.5 版本,换音频编码器、加速推理,支持多任务与多场景。经770人评测,它在多维度领先对手,各方面表现均衡,效率与质量兼得。

AIGC开放社区
算法论文7

1美元Token撬动4800美元收益!AI挑战百万美元级基准,最赚钱的Agent出现了

Humanlaya Data Lab等机构构建$OneMillion - Bench评测基准,用经济价值衡量模型。它含400道高难题目,覆盖多领域。目前最强模型能产出约50万美元价值,但离可交付专业任务还有距离。

机器之心
推荐文章7

微前端:迈向现代化前端架构的社会技术之旅

文章指出微前端不仅是技术模式,更是组织工作新范式。介绍其适用场景、演进现有系统方法,处理路由等跨领域问题策略,还强调它能让前端独立于后端现代化,实现渐进式变革。

InfoQ
算法论文8

从代码基座模型到智能体与应用:代码智能的全面综述与实践指南

北航、阿里等机构联合发布论文,系统梳理 2021 - 2025 年代码大模型发展。介绍代码基座模型、评测任务、对齐技术等,还提及软件工程智能体、安全防御及训练指南,预言未来编程走向。

深度学习自然语言处理
新闻资讯8

李飞飞押注的3D世界模型黑科技,被这篇论文一次性扒光!

李飞飞创业公司World Labs发布空间智能模型成果,推出Marble平台。本文分享3D、4D世界模型技术综述,系统梳理原生表示的世界模型,给出分层分类法、数据集与评测指标,并开源维护。

PaperAgent
开源动态8

百川开源医疗增强大模型 Baichuan-M2:更符合中国临床诊疗场景,可 4090 单卡部署

百川智能发布并开源医疗增强大模型 Baichuan-M2,以更小尺寸反超 OpenAI 新模型。它可 4090 单卡部署,成本低,在 HealthBench 评测表现佳,免费开源,更适配中国临床诊疗场景。

InfoQ
开源动态7

GPT-5认为这个模型是开源界的Claude 3.5——陈天桥朋友圈里的 MiroMind ODR 让我眼前一亮

陈天桥用GPT - 5评测自家开源模型MiroMind ODR,让其应对复杂问题。GPT - 5评价该模型是“开源界的Claude 3.5”,其能力让GPT - 5“点赞”,有闭源模型稳定性和可用性,还具全开放架构。

AI科技评论
开源动态8

开源医疗模型SOTA:蚂蚁健康发布百亿参数医疗大模型

由浙江省卫生健康信息中心、蚂蚁健康等联合开发的AntAngelMed医疗大模型正式开源。它凭借独创训练与架构,在权威评测中表现优异,降低算力门槛,将专业知识、诊疗能力与计算架构融合,为医疗AI落地奠基。

AIGC开放社区