大模型发布潮」共找到 10236 篇相关文章

开源动态8

快手Klear-Reasoner登顶8B模型榜首,GPPO算法双效强化稳定性与探索能力!

快手Klear团队推出Klear-Reasoner模型,基于Qwen3 - 8B - Base打造,在多基准测试达同规模SOTA。其核心GPPO算法能强化稳定性与探索能力,团队还对训练流程多环节深入分析,给出优化策略。

AI前线
算法论文8

模型合体!上交&上海AI Lab&华师提出LED-Merging,拒绝「能力」与「安全」二选一

上海人工智能实验室等团队提出LED - Merging解决模型融合“安全 - 效用冲突”问题。该方法无需训练,像“神经元手术刀”,不牺牲专业能力还提升安全性,论文已被ACL 2025 Main Conference接收。

深度学习自然语言处理
算法论文8

杜克学、Zoom推出LiveMCP‑101:GPT‑5表现最佳但未破60%,闭源模型Token效率对数规律引关注

杜克学与Zoom研究者推出LiveMCP - 101,这是针对真实动态环境的MCP - enabled Agent评测基准。含101个任务,实验显示先进模型成功率低于60%,研究为提升Agent能力提供改进方向。

机器之心
新闻资讯7

哈萨比斯出的难题,GPT之父接上了:用一个知识停在1930年的模型

GPT之父Alec Radford等用1931年前数据训练13B模型Talkie,切断现代知识污染。研究者测试其能力,探讨它对未来的“预感”、规避污染问题及数据多样性等,同时训练中也面临时间泄漏、数据质量等难题。

机器之心
开源动态8

Qwen3技术报告首次全公开!“混合推理模型”是这样炼成的

本文首次公开Qwen3技术报告,介绍其模型架构、预训练及后训练过程、性能表现等技术细节。Qwen3整合两种模式,引入思考预算机制,降低轻量级模型计算资源,在多基准测试领先,多语言支持扩展至119种,所有模型开源。

通义千问Qwen
算法论文8

挑战Claude4的8B Agent!NUS提出AgenTracer:面向多智能体系统的失败归因

随着语言模型发展,多智能体系统潜力但有系统脆弱性问题。NUS研究者在论文中提出AgenTracer框架,构建标注管线,设计AgenTracer - 8B模型,在失败归因任务上超型闭源模型,还能助力系统自我提升。

PaperAgent
算法论文8

ICLR 2026|首个微观世界模型MicroVerse来了,AI开始模拟看不见的世界

过去两年,世界模型成为模型演进重要方向,但现有模型多聚焦宏观世界。本文提出MicroVerse模拟框架,将研究边界拓展到微观尺度,还推出MicroWorldBench评测基准和MicroSim - 10K数据集,推动AI从视觉模拟迈向科学模拟。

机器之心
开源动态8

字节开源首个时空推理视频模型!思考过程全透明,性能超越GPT-4o

和字节联合团队推出开源模型Open-o3 Video,将显式时空证据嵌入视频推理全过程,采用non-agent架构,性能超越GPT - 4o等闭源模型。该模型构建了STGR语料体系,采用双阶段训练,实验表现优秀。

量子位
新闻资讯7

独家|前DeepSeek核心研究员魏浩然出任百度文心多模态算法负责人

9月3日消息,原DeepSeek核心研究员魏浩然带队转入百度,任文心模型多模态算法负责人。此前他在多模态与端到端OCR底层重构有突出成绩,这是百度布局青年顶尖研发人才的又一动作。

AI前线
开源动态7

GPT-5认为这个模型是开源界的Claude 3.5——陈天桥朋友圈里的 MiroMind ODR 让我眼前一亮

陈天桥用GPT - 5评测自家开源模型MiroMind ODR,让其应对复杂问题。GPT - 5评价该模型是“开源界的Claude 3.5”,其能力让GPT - 5“点赞”,有闭源模型稳定性和可用性,还具全开放架构。

AI科技评论