训练框架slime」共找到 3407 篇相关文章

开源动态8

DeepSeek-V3.1震撼发布,全球开源编程登顶!R1/V3首度合体,训练量暴增10倍

DeepSeek正式上线DeepSeek-V3.1,作为首款「混合推理」模型,将开启智能体新时代。它参数共671B,具强大智能体能力,编程击败Claude 4,训练量大幅扩增,在多方面测试表现出色,稳坐编程开源第一王座。

新智元
推荐文章7

直播预约 | 如何缓解LLM-as-a-Judge的潜在偏好?UDA:一种无需人工标注的无监督去偏对齐框架

论文针对不同大模型对同一组大模型回答打分差异大等问题,提出无需人工标注、模型无关、即插即用的UDA框架,以无监督方式动态调整Elo评分,实验表明该方法能降低打分标准差、提升与人类评分相关系数。

深度学习自然语言处理
产品应用8

32倍加速,58秒搞定720p视频!字节发布离散自回归框架,统一视觉生成和长视频生成

字节发布InfinityStar框架,将5秒720p视频生成时间从30多分钟缩至58秒,还支持多样任务。它基于对视频本质思考设计时空金字塔模型,将时空分离,通过多项技术优化,性能表现出色,不过也存在一些技术局限。

AIGC开放社区
开源动态8

小红书hi lab首次开源文本大模型,训练资源不到Qwen2.5 72B 的四分之一

6月6日,小红书hi lab团队首次开源文本大模型dots.llm1,采用MIT许可证。该模型激活参数量140亿,总参数量1420亿,上下文长度32K。训练资源不到Qwen2.5 72B的四分之一,在多个测评中表现出色。

AI前线
算法论文8

北大 & 作业帮团队提出 Text-to-SQL 新框架 Interactive-T2S,攻克宽表处理与低资源对齐难题

北大与作业帮联合研发的论文提出 Interactive-T2S 框架,将 LLM 塑造成智能代理,通过多轮交互解决传统 Text-to-SQL 方法在宽表处理、低资源对齐等方面的难题,已入选国际顶会 CIKM2025。

AI前线
算法论文8

仅看视频就能copy人类动作,宇树G1分分钟掌握100+,UC伯克利提出机器人训练新方式

UC伯克利团队研发出名为VideoMimic的新系统,能将视频动作迁移到真实机器人。它已让宇树G1模仿100多段人类动作,还能适应各种地形。其工作流程含视频转仿真、仿真训练策略、策略迁移到实体机器人。

量子位
开源动态8

牛!小米开源「音频语言模型」,超1亿小时预训练时间,音频理解和输出能力是真顶!

小米推出开源音频语言模型MiMo - Audio,有超1亿小时预训练时间。它能理解音频,70亿参数模型在多基准测试达SOTA,音频理解超Gemini - 2.5 - Flash,复杂推理优于GPT - 4o - Audio,还支持多模态任务。

开源AI项目落地
开源动态8

面向6G环境感知通信!西电开源3Dx3D无线电地图数据集与生成式基准框架

面向6G,西安电子科技大学等团队联合提出高分辨率多模态三维无线电图谱数据集UrbanRadio3D,构建三维无线电图生成框架RadioDiff-3D,弥补了当前主流RM构建方法与数据集的局限。

新智元
算法论文8

牛津VGG、港大、上交发布ELIP:超越CLIP等,多模态图片检索的增强视觉语言大模型预训练

牛津VGG、港大、上交大团队论文提出ELIP方法,用学术界资源增强视觉语言大模型预训练,用于文字 - 图片检索。该论文被大会接受并获最佳论文提名。ELIP可应用于多个大模型,实验显示能显著提升图片检索表现。

机器之心
开源动态8

Github 轻松斩获 30k+ Star,桌面应用开发太丝滑,Tauri框架能重塑桌面App开发?别错过,抓紧上车

Tauri是开源框架,用Rust后端和本地WebView,打造轻量、高性能、安全的跨平台应用,在GitHub获超30000 Star。它能解决Electron应用体积大、性能慢等痛点,功能亮点多,应用场景丰富。

小华同学ai