训练资源」共找到 2483 篇相关文章

推荐文章8

Sebastian Raschka 新书《从头开始推理》抢先看,揭秘推理模型基础

著名AI技术博主Sebastian Raschka新书《Reasoning From Scratch》第一章介绍LLM中推理含义、训练阶段、模式匹配与逻辑推理区别,还讲述提升推理能力方法及从头构建推理模型的重要性等内容。

机器之心
推荐文章7

ACL'25首届博士论文奖 | 重新思考 LLM 中的数据使用

近日,第一届 ACL 计算语言学博士论文奖获得者是 Sewon Min,其论文《重新思考大型语言模型中的数据使用》围绕大型语言模型如何使用训练所用的庞大文本语料库展开研究。

PaperAgent
算法论文7

SRO架构赋予Qwen-2.5-VL推理能力,性能飙升16.8%

文本领域推理模型成就大,但扩展到多模态大语言模型遇阻力,如冷启动初始化不足等。为此提出 SRO 三阶段训练框架,经测试,ReVisual - R1 平均性能提升 16.8 个百分点。

CourseAI
开源动态8

GitHub 1.8W star爆款!不到2M,win系统高级感拉满!

TranslucentTB是为Windows系统设计的开源轻量级工具,主打任务栏透明化。它资源占用低,功能丰富,有多种视觉效果、能智能动态切换等,还提供多种安装渠道。

开源先锋
新闻资讯7

Anthropic 发文称自家 Claude 已经开智,网友:为了上市,不择手段?

Anthropic发布Claude内部机制新研究,介绍J-space和J-lens,称可读取模型未输出的内部概念。此研究在训练、评测和部署有潜在价值,但叙事引发争议,网友质疑是否过度包装。

AI科技评论
开源动态8

中科院甩出多模态“核弹”!类GPT-4o多模态模型开源!支持语言-视觉-语音任意组合交互!

中国科学院计算技术研究所(ICTNLP)开源类GPT - 4o多模态模型Stream - Omni,支持文本、视觉和语音任意组合交互,核心是高效模态对齐技术,少量多模态数据即可训练,有多种使用场景。

开源星探
开源动态7

Qwen 3 VL 模型已并入 llama.cpp,ollama同步支持

近日,Qwen 3 VL 系列模型合并到 llama.cpp 项目,支持图像输入和多轮对话,解决了架构兼容性问题。功能已入主干分支,运行需足够资源。Ollama 最新版同步支持其本地化。

AI工程化
推荐文章8

上交博士最新思考:仅用两个问题讲清强化学习

上交博士 Kun Lei 博客提出用两个问题理解强化学习:数据从哪来、策略更新多频繁。借此梳理算法逻辑,还延伸到机器人基础模型,指出训练节奏与其实践契合。

AI科技评论
新闻资讯7

这个叫STOP AI 的极端组织要求:立即销毁ChatGPT

Stop AI组织自称「非暴力公民抵抗组织」,发布政府诉求清单,要求禁止训练超10^12 FLOPs神经网络,销毁GPT - 4等模型,还提出多项激进诉求,引发网友热议。

AGI Hunt
产品应用8

刚刚,Thinking Machines出手!首款交互模型来了,翁荔出镜实测

Thinking Machines Lab推出首个大模型TML - Interaction - Small,打破传统人机交互模式,实现全自然交互。它训练范式独特,采用双模型架构等设计,评测表现超GPT - Realtime 2.0等模型,后续还会推出更大尺寸模型。

机器之心