「高质量训练数据」共找到 4352 篇相关文章
【博客转载】CUDA Vectorized Memory Access (文末送书)
文章展示如何用向量化内存访问提高CUDA函数有效内存带宽,实现朴素自定义设备内存拷贝函数,对比不同数据类型、大小及方法的性能,得出拷贝数据单元多、单元大及以8或16字节向量化单元拷贝可提升带宽等结论。
参数破万亿!阿里Qwen3-Max-Thinking发布,编程能力“踢馆”Gemini与Claude
阿里发布总参数超万亿的Qwen3 - Max - Thinking,预训练数据规模达36T Tokens。在多项权威测试中表现优异,能与顶级闭源模型竞争。引入两项核心创新,千问App等已上新,网友认可其能力与更新速度。
斯坦福提出新的RL范式,让3B模型的Agent超越Claude、GPT-4
斯坦福提出新的RL范式,让小模型Qwen2.5 - 3B经训练后性能超越Claude - 3.5 - Sonnet等大模型。论文解决了RL在代理环境中可变时长动作优化偏差和稀疏奖励两大挑战,为AI代理发展指明方向。
刚刚,小红书开源了首个多模态大模型dots.vlm1,性能直追SOTA!
小红书人文智能实验室(hi lab)低调开源视觉语言模型dots.vlm1。该模型基于自研视觉编码器构建,在视觉理解和推理任务上接近SOTA水平,实测表现惊艳,还介绍了其技术架构、预训练数据布局等内容。
CIO 正在抛弃 AI 生码率:一场关于什么才算产研提效的实践复盘
阿里云CIO蒋林泉团队复盘AI时代产研组织效能提升实践。指出多数企业用AI停于工具替换,AI生码率等指标存误区。介绍团队从多方面重构产研组织,如左移质量测试等,还提出新岗位与框架,分享对工具、组织和人的见解。
刚刚,OpenAI正式发布o3-pro!奥特曼激动更新博客:温和的奇点
今日凌晨,OpenAI发布o3-pro,Pro订阅用户可通过ChatGPT和API使用。其在多项任务表现出色,但在ARC-AGI数据集上与o3相近且成本高。网友测试评价不一,此外OpenAI CEO奥特曼还发表博客展望AI未来。
社区供稿丨Jina-VLM:可在笔记本上跑的多语言视觉小模型
Jina AI发布2.4B参数量的视觉语言模型Jina - VLM,在多语言视觉问答任务达SOTA。它引入注意力池化,连接视觉与语言基座,处理问答等任务,对硬件要求低,多项测试表现优,还介绍架构、训练策略和上手方式。
2025-04-努力不是做好事情最重要的因素
作者分享个人生活、工作等多方面情况,提及播客发布,认为努力非工作做好的关键因素,深入探讨Agent在业务应用中的问题,还谈及视频更新、投资经历等,最后表示要审视目标、精简事务。
为什么说多模态是推荐系统破局的关键?来自饿了么一线的实战复盘
文章围绕多模态推荐展开,从传统推荐算法演进到多模态表征技术,结合饿了么场景实践,还探索生成式推荐。介绍多模态推荐挑战与代表性工作,梳理表征技术发展,详述饿了么系统设计与训练,分析生成式推荐方案及业界路线。
超越GPT-4o!华人团队新框架让Qwen跨领域推理提升10%,刷新12项基准测试
加拿大滑铁卢大学与TikTok新加坡的华人团队提出全新训练框架General - Reasoner,让Qwen系列大模型跨领域推理准确率提升近10%,在多项基准测试中超越GPT - 4o。该框架有全领域推理数据集和生成式答案验证器两大创新。