「训练数据污染」共找到 3947 篇相关文章
Cursor终结者?Grok 4正式登顶!马斯克扬言编程碾压,20万N卡年赚47亿美金!
时隔5个月,xAI发布通用模型Grok 4,后续还将推三款模型。Grok 4上线,有三个订阅版本。马斯克称其智能超博士生,多项基准测试领先,编码或超Cursor。其性能强大源于训练投入和计算扩展。
机器人全程自主收拾客厅!390亿美元估值机器人端到端新技能,英伟达持续加注
估值390亿美元、英伟达持续看好的Figure机器人有新进展,能完全自主、端到端全流程整理客厅。背后是其自主研发的具身大脑Helix 02系统,仅补充新数据就能掌握全新任务。
清华姚班团队,开源具身智能视觉语言动作(VLA)模型工具箱,打造行业通用技术底座
清华姚班团队所在的原力灵机公司,开源了基于PyTorch的视觉语言动作(VLA)模型工具箱Dexbotic。它能打造通用底座,解决行业研发困境,其预训练模型表现出色,还与Hugging Face合作推出评测平台。
告别AI“乱画图表”!港中文团队发布首个结构化图像生成编辑系统
现有AI生图工具在结构化图像生成上问题多,理解与生成能力有鸿沟。港中文等校联合团队提出首个综合性方案,涵盖数据集构建、模型优化、评估基准三大模块,助多模态模型画准图,推动其发展。
阿里开源DeepResearch模型,超强“AI研究员”,开启自主智能体新纪元
阿里巴巴通义实验室开源Tongyi DeepResearch模型,是全球首个性能能与OpenAI DeepResearch较量且全开源的Web Agent。它采用先进架构,有两套推理范式,训练方法论有创新,实测表现佳,应用场景广,用Apache - 2.0许可证。
一文看懂“存算一体”
文章介绍存算一体概念,它因传统冯·诺伊曼架构在数据爆炸、AI崛起下暴露“存储墙”“功耗墙”问题而提出。阐述其发展历程、技术路线、存储介质、应用场景,也指出技术、生态、市场方面挑战,前景潜力大。
超越O4-mini,多模态大模型终于学会回头「看」:中科院自动化所提出GThinker模型
现有多模态大模型在通用场景推理有瓶颈,缺乏对视觉线索校验与再思考能力。中科院自动化所提出GThinker模型,有创新的「线索引导式反思」模式,经两阶段训练,性能超O4 - mini,论文等已开源。
推荐系统进入“大模型时刻”:昇腾NPU如何支撑千亿级生成式推荐落地
文章基于华为郭威在2025 AICon大会演讲,复盘华为推荐技术探索。介绍FuXi-α、β模型设计,解决训练和推理难题;分享“多阶段统一建模”进展,提出Performance Law;还介绍了训推系统优化及未来聚焦“强算力”“强模型”融合。
马斯克暴走官宣:Grok 5就是AGI!五月连轰两代万亿怪兽,OpenAI慌了
马斯克宣称Grok 5就是AGI,5月将连发1T和1.5T两代万亿参数模型。Grok 4.3已上线,4.4、4.5将相继推出,Grok 5正以6万亿参数规模训练。不过,参数能否堆出AGI存争议。
告别碎片化日志:一套方案采集所有主流 AI 编程工具
在AI编程工具普及的当下,有效采集和分析AI代码生成数据成重要课题。该文介绍一套基于MCP架构的多AI工具代码采集方案,支持多种工具和操作系统,有轻量化、用户无感等特点,已和Aone合作。