开发团队模型」共找到 9953 篇相关文章

开源动态8

蚂蚁Ring-1T正式登场,万亿参数思考模型,数学能力对标IMO银牌

10月14日凌晨,蚂蚁万亿级思考模型Ring-1T正式登场,这是全球首个开源的万亿参数思考模型。它在多项基准测试中表现出色,数学能力达IMO银牌水平,还展示了强大的代码、推理、写作等能力,其背后是IcePop算法与ASystem框架的支撑。

机器之心
开源动态7

Anthropic 定义了标准,我们造了库:为什么 2026 是 Agent Skills 元年

2025 年 12 月 18 日,Anthropic 将 Agent Skills 发布为跨平台开放标准,终结了 Agent 开发混乱。特赞团队推出 `skill0` 响应标准,其诞生源于企业业务需求,2026 年 Agent 开发将质变。

AI寒武纪
开源动态8

OPPO AI重磅发布:深度研究智能体,离“真正好用”还有多远?我们给大模型做了一次全身体检

2025年,Deep Research成AI热点,OPPO AI Agent Team对大模型评测。发布论文,开源评测基准FINDER和失败分类体系DEFT,揭示AI“装懂”“缺乏韧性”问题,还分析模型表现并给出发展建议。

深度学习自然语言处理
开源动态8

不用千亿参数也能合成高质量数据!这个开源框架让小模型“组团逆袭”,7B性能直追72B

上海人工智能实验室与中国人民大学提出GRA框架,以“多人协作”理念让小模型分工生成高质量训练数据。实验显示其生成数据质量高,项目已开源。它打破对大模型蒸馏依赖,展现“集体智能”潜力。

量子位
算法论文8

后生可畏!何恺明团队新成果发布,共一清华姚班大二在读

何恺明团队继5月提出MeanFlow (MF) 后,近日推出改进版Improved MeanFlow (iMF),解决了原始MF三大核心问题。它重构预测函数,还实现灵活的无分类器指导和高效的上下文内条件作用架构,提升了实用性和效率。

量子位
新闻资讯8

全球顶尖大模型一夜惨遭血洗!最难测试人类拿满分,AI第一名得0.2%分

全球最难AGI测试ARC - AGI - 3上线,人类满分通关,最强模型Opus 4.6仅得0.2%。测试从静态题变为互动游戏,评分看效率。前沿大模型得分低,非LLM方案表现更好,AI缺乏元认知能力。

新智元
开源动态8

节前重磅:开源旗舰模型新SOTA,智谱GLM-4.6问世

国庆前智谱AI发布新一代旗舰模型GLM-4.6并将开源,它在多方面提升,如编码、上下文长度等,评测性能佳,token消耗降低。经实测,其代码、研究、开发等能力强,成全球开源AI领域重要力量。

机器之心
算法论文7

超越Claude 3.5和o1!8B模型靠「分层投票+测试时训练」逆袭

近日MIT研究者发现测试时训练在大模型应对复杂推理问题时,能分解任务提升回答准确率。8B的lemma3模型经此方法,在ARC和BBH数据集上性能显著提升,超Claude 3.5等。但该策略部署效率低。

新智元
产品应用7

豆包大模型2.0+Claude Skills,3步装好,终于有AI能帮我"看视频做笔记"了!火山引擎全系列可用!

传统视频总结工具只基于音频总结,内容浅显。而豆包大模型2.0是多模态原生模型,能同时处理画面和声音。只需3步安装配置,就能让它真正“看”视频,输出详细笔记。

AI产品自由
开源动态8

VLNVerse“宇宙降临”:吴琦团队交出2025具身导航最终答卷

自2018年吴琦团队发表首篇VLN论文后,领域碎片化问题凸显。2025年末其推出全栈平台VLNVerse,涵盖场景生成、物理模拟、任务基准和通用模型,欲打通Real2Sim2Real,推动VLN向Embodied VLN跨越。

AI科技评论