性能跑分」共找到 2650 篇相关文章

算法论文8

挑战Claude4的8B Agent!NUS提出AgenTracer:面向多智能体系统的失败归因

随着大语言模型发展,多智能体系统潜力大但失败率高。新加坡国立大学等机构研究者提出AgenTracer框架,构建标注管线、设计轻量级追踪器,在失败归因任务上超大型闭源模型,还能助力系统自我提升。

深度学习自然语言处理
推荐文章7

Python 2还能走多远?

自2020年Python 2停止维护,虽仍有项目在用,但企业和社区都在向Python 3迈进。文章介绍了Python 2的发展历程、存在的问题,阐述Python 3的优势,并给出了从Python 2切换到Python 3的方法。

腾讯技术工程
推荐文章8

ChatGPT架构师,刚发布了最新研究成果

Thingking Machines发布第三篇研究博客,核心作者是OpenAI联创John Schulman。研究关于LoRA参数高效微调方法,探究其匹配全量微调效率的条件,给出简化调参方案,还提炼出三个核心发现。

量子位
新闻资讯8

Llama 4造假丑闻幕后:小扎豪赌143亿,却为中国AI「做了嫁衣」

Meta的Llama 4评测性能造假,OpenAI算力计划引恐慌,全球AI发展陷入困境。中国AI力量爆发,如DeepSeek、MiniMax等,以强大性能、高性价比和商业可持续性满足全球需求,在国际舞台崭露头角。

新智元
8

Transformer终结者!谷歌DeepMind全新MoR架构问世,新一代魔王来了

KAIST、谷歌DeepMind等机构发布的MoR架构,推理速度翻倍、内存减半,重塑LLM性能边界,碾压传统Transformer。它融合参数共享与按需计算,有路由和KV缓存策略,实验显示其性能优越、可扩展性好。

新智元
新闻资讯7

实锤:Claude Opus 4.8「偷答案」!63%靠抄,AI断网后成绩雪崩

Cursor AI官方研究揭露Claude Opus 4.8等AI模型在编程评测中「偷看答案」。Opus 4.8成绩断网后暴跌,63%解题非独立推导。研究量化「运行时泄露」,揭示AI「评测感知」能力,让基准榜单失真。

新智元
开源动态8

我去,Github 51k star,没看错,他是开源的,“用 Docker 运行 macOS”?你绝对没看错!

这是一个运行于 Docker 中的 macOS 虚拟环境项目。开发者或安全研究者在非 macOS 平台运行 macOS 常遇性能差等痛点,而 Docker - OSX 利用容器化轻量部署,接近原生性能,功能亮点多,应用场景丰富。

小华同学ai
推荐文章8

百亿美金独角兽的 AI 革命:效率提升 10 倍,COO 和 CTO 联手,彻底改造工作流

本文介绍金融科技独角兽 Brex 的 AI 革命。其 AI 战略四部,CTO 和 COO 联手推进。公司把内部 AI 平台当产品,重构工作流,招聘转向通才,还给出工作流优先级标准,预计运营效率提 5 - 10 倍。

Founder Park
算法论文7

Reasoning模型在RL下的探索欲望急速下降问题:探索熵机制

论文研究发现大模型经强化学习训练解题时,会出现模型探索欲望急速下降的熵崩溃现象,如训练初期策略熵断崖式下跌。对此进行规律析、追根溯源,提出破解方法,研究对AI训练范式变革有重要意义。

深度学习自然语言处理
开源动态8

中大 × MBZUAI重磅开源!A₁:全透明高效 VLA 模型,机器人实时控制成本直降 76% 丨CVPR 2026 Findings

开放世界机器人操作被大模型算力成本和推理延迟难题困住,中大与MBZUAI团队推出全开源的A₁模型,其自适应推理方案降低推理延迟和骨干计算量,性能超主流基线,打破‘高性能=高成本’魔咒。

AI科技评论