「后训练技术」共找到 6037 篇相关文章

算法论文8

模型汤新做法!Meta|提出“类别专家汤”:SoCE,大幅提升模型性能,刷新SoTA!

大语言模型领域,提升性能常需高算力、大量数据和长时间训练。Meta提出新型模型汤技术SoCE,通过分析类别相关性操纵模型权重,在BFCL上刷新SOTA记录,为开源社区指明低成本进化之路。

AINLPer
产品应用7

Claude code skills 怎么用来写作?

作者成峰分享用Claude Code的Skills功能写作的方法。先做写作准备,再用Skills辅助写作,介绍其优势、建立方法,最后排版发布。强调有效AI写作是让AI执行方法论,形成闭环。

AI产品自由
新闻资讯8

从好莱坞特效到AI芯片的十年之约:SIGGRAPH Asia 2025登陆香港!

2025年12月15 - 18日,SIGGRAPH Asia将在香港举办。相比2014年深圳会议,中国图形领域已从跟跑变引领。此次会议亮点多,能展示中国技术突破,还为从业者提供交流合作机会。

新智元
算法论文8

用155万模拟视频给模型上课!GVE模型一次学会9种视频检索技能

当前视频检索研究陷入困境,现有模型难以应对复杂检索需求。香港科技大学(广州)联合阿里巴巴通义实验室推出通用视频嵌入模型GVE,其在零样本设置下超越14个主流模型,全链条创新为视频检索通用化奠定基础。

量子位
算法论文7

Zero-RAG,对冗余知识说“不”

文章指出大语言模型知识冗余,RAG 检索效率低。复旦大学邱锡鹏提出 Zero - RAG,能精准识别并剪除冗余知识,砍 30%语料准确率掉点小,检索延迟降 22%,还介绍了其技术方案。

PaperAgent
开源动态8

两周复刻DeepSeek-OCR!两人小团队还原低token高压缩核心,换完解码器更实用

两人小团队仅用两周复刻DeepSeek-OCR,复刻版DeepOCR还原其低token高压缩核心优势,还在关键任务上追上原版表现。它完全开源,无需大规模算力集群,训练方案适配中小团队。

量子位
产品应用8

360发布全球最强视觉语言对齐模型!榜单全面领先!

360发布FG - CLIP 2双语细粒度视觉语言对齐模型,几乎在所有数据集上全面领先。它能让AI在统一框架内看懂图像细节、理解中英双语,团队还提出新中文多模态评测基准。

AIGC开放社区
产品应用7

Suno V5让整个B站开始文艺复兴了。

文章指出B站鬼畜区曾没落,如今因Suno V5迎来文艺复兴。爆款AI音乐鬼畜频出,如漫游会议室的作品。介绍了用Suno V5创作歌曲及视频的方法,还强调鬼畜精神回归,小破站分享快乐的意义未变。

数字生命卡兹克
算法论文8

RAE的终极形态?北大&阿里提出UniLIP: 将CLIP拓展到重建、生成和编辑

北大和阿里团队提出 UniLIP,解决了统一多模态模型中语义理解与像素重建的矛盾。它创新微调 CLIP,实现图像重建,还提出双条件架构用于生成和编辑,在多基准取得 SOTA 性能。

机器之心
新闻资讯7

摩尔线程科创板IPO注册获批

10月30日,摩尔线程科创板IPO注册获证监会许可,是科创板‘1+6’改革后高效完成注册的硬科技企业。其从受理到过会仅88天,构建智算产品线,夸娥万卡智算方案优势明显。

芯师爷