后训练课程」共找到 3813 篇相关文章

算法论文8

模型汤新做法!Meta|提出“类别专家汤”:SoCE,大幅提升模型性能,刷新SoTA!

大语言模型领域,提升性能常需高算力、大量数据和长时间训练。Meta提出新型模型汤技术SoCE,通过分析类别相关性操纵模型权重,在BFCL上刷新SOTA记录,为开源社区指明低成本进化之路。

AINLPer
新闻资讯7

复盘小鹏机器人风波:当一个机器人需要“自证清白”|甲子光年

本文复盘小鹏机器人IRON风波,从科技日发布现场无人质疑,到网络舆论质疑造假,何小鹏亲自下场自证。还分析了公众质疑原因,介绍机器人技术,指出行业应回归应用本质,小鹏IRON将优先进入商业场景。

甲子光年
产品应用7

Claude code skills 怎么用来写作?

作者成峰分享用Claude Code的Skills功能写作的方法。先做写作准备,再用Skills辅助写作,介绍其优势、建立方法,最排版发布。强调有效AI写作是让AI执行方法论,形成闭环。

AI产品自由
推荐文章8

从华为“弃将”到打造两家上市公司,他如何成为中国“工控之王”?

过去二十多年,朱兴明打破欧美垄断,提升中国工业自动化核心零部件水平。他曾是华为员工,创立汇川技术,带领其上市,还拆分出联合动力上市。他决策有得有失,如今又瞄准新领域。

芯师爷
算法论文8

用155万模拟视频给模型上课!GVE模型一次学会9种视频检索技能

当前视频检索研究陷入困境,现有模型难以应对复杂检索需求。香港科技大学(广州)联合阿里巴巴通义实验室推出通用视频嵌入模型GVE,其在零样本设置下超越14个主流模型,全链条创新为视频检索通用化奠定基础。

量子位
新闻资讯7

一篇文章告诉你:国产 GPU 背的技术和商业路线异同

过去两年,国产 GPU 赛道进入公开财务与审视阶段。文章分析了摩尔线程、沐曦等企业不同技术与商业路线,如摩尔线程走“高启动+快扩张”,沐曦选“厚积薄发+先服务高端算力场景”等。

芯师爷
开源动态8

两周复刻DeepSeek-OCR!两人小团队还原低token高压缩核心,换完解码器更实用

两人小团队仅用两周复刻DeepSeek-OCR,复刻版DeepOCR还原其低token高压缩核心优势,还在关键任务上追上原版表现。它完全开源,无需大规模算力集群,训练方案适配中小团队。

量子位
开源动态7

【CUDA-MODE学习笔记】Lecture 40: CUDA Docs for Humans(文末送书

本文是CUDA-MODE课程笔记,介绍Modal公司GPU术语词汇表项目,讲师分享职业历程,强调理解CUDA技术栈各层次重要性,还讨论了项目短、中、长期目标,是助力开发者掌握CUDA的教育项目。

GiantPandaLLM
产品应用8

360发布全球最强视觉语言对齐模型!榜单全面领先!

360发布FG - CLIP 2双语细粒度视觉语言对齐模型,几乎在所有数据集上全面领先。它能让AI在统一框架内看懂图像细节、理解中英双语,团队还提出新中文多模态评测基准。

AIGC开放社区
产品应用7

Suno V5让整个B站开始文艺复兴了。

文章指出B站鬼畜区曾没落,如今因Suno V5迎来文艺复兴。爆款AI音乐鬼畜频出,如漫游会议室的作品。介绍了用Suno V5创作歌曲及视频的方法,还强调鬼畜精神回归,小破站分享快乐的意义未变。

数字生命卡兹克