训练平台」共找到 3381 篇相关文章

开源动态8

把RoPE扔掉,AI更能看懂长上下文!Transformer作者团队开源大模型预训练新方法

Transformer架构核心作者之一Llion Jones团队开源新技术DroPE,可丢弃位置嵌入扩展上下文,解决RoPE长序列处理缺陷,在多模型实验中表现卓越。该团队来自Sakana AI,此前还有相关研究成果。

量子位
推荐文章7

AI优质信息源整理:高质量网站、博主与Twitter资源推荐

文章整理了AI优质信息源,介绍Twitter在AI浪潮中的重要性及筛选优质信息流方法,还列举知乎、B站等平台,以及资讯平台、网站、播客、博客等资源,给出挑选标准和了解领域的技巧。

AI Reading Hub
算法论文7

英伟达发现RL Scaling!创造力暴涨,做基座模型做不了的事!

过去学界争论强化学习(RL)对语言模型的作用,此前研究认为其效果有限。本文发现问题出在训练时间短,提出ProRL,让训练突破2000步以上,结果惊人,小模型也能有出色表现。

深度学习自然语言处理
算法论文8

最新研究揭示视觉模型与人脑的对齐机制

FAIR与巴黎高等师范学院通过训练自监督视觉Transformer模型(DINOv3),评估脑 - 模型相似性。发现模型大小、训练数据量和图像类型影响相似度,DINOv3学到的表征会逐步与人脑一致。

量子位
新闻资讯8

刚刚,AMD、OpenAI联合发布超强AI芯片,推理提升35倍

今天凌晨,AMD举办2025全球AI发展大会,与OpenAI联合发布Instinct MI400、Instinct MI350系列超强AI芯片。MI350推理性能提升35倍,MI400内存配置大幅提升。AMD还开源ROCm7平台,7大AI平台与其合作。

AIGC开放社区
开源动态8

浙大联合北大开源 Easel:一个 Agent 包办社媒全链路,从热点发现到多平台发布!

浙江大学和北京大学联合开源Easel,这是面向社媒创作者的内容工作台,用一个Agent打通全链路,有画像驱动等六大亮点,还给出清晰的快速上手流程。

开源星探
开源动态8

Code Arena全球可用模型第一!智谱GLM-5.2上线并开源

智谱上线并开源GLM-5.2,在Code Arena等平台表现优异,长任务跑分出色,架构有突破,支持100万token上下文,还引入控制功能。模型在常用编程智能体可用,适配国产算力平台,以MIT协议开源。

AIGC开放社区
开源动态8

企业级OpenClaw最强拍档来了!万亿参数的国产多模态大模型,刚刚开源发布

YuanLab.ai团队开源源Yuan3.0 Ultra多模态基础大模型,是万亿级开源多模态大模型之一。它优化训练效率,在多任务表现突出,为企业Agent AI提供支撑,还提出新算法和训练策略,全面开源推动落地。

量子位
算法论文7

OpenAI谈:大模型为什么会有幻觉?如何避免?

OpenAI论文探讨大模型幻觉问题,指出评测缺陷,像多数AI模型评测非对即错,模型为得分会瞎猜。还从预训练和后训练阶段剖析根源,提议改造评测,引入置信度阈值和错误惩罚机制。

探索AGI
产品应用7

TokenDance 首发上线 GLM-5.2,内测一周后今日正式开放

今日,TokenDance 平台首发接入智谱最新旗舰模型 GLM-5.2 并面向外部用户开放。它是面向开发者与企业的大模型聚合平台,用户接入一个 API Key 就能调用多种主流大模型。此前团队已对 GLM-5.2 深度内测与适配。

特工宇宙