「数据制备系统」共找到 3890 篇相关文章
开源多模态推理「破壁」时刻:MMFineReason助力4B逆袭30B
长期以来,开源多模态模型在复杂推理任务上与顶尖闭源模型有差距,核心痛点是高质量推理数据匮乏。上海AI实验室OpenDataLab团队开源MMFineReason框架及大规模数据集,小模型凭此实现性能逆袭。
用得越多、失业越快?GitHub 大改 Copilot 规则:默认拿个人代码训练 AI,还搬出 Anthropic 挡枪!
当地时间3月26日,GitHub宣布自4月24日起,Copilot Free、Pro和Pro+用户交互数据默认用于训练改进AI模型,但用户可手动退出。它称此举因模型需更多数据,还拿微软等挡枪,却遭开发者吐槽。
Claude Code 更长更快!Agent能自己管项目了!从 Todo 升级到 Task
上周Claude Code团队更新任务清单系统,从「记事本」升级为「项目管理系统」。因模型能力增强,需求变复杂,原TodoWrite无法满足,新Task系统解决了任务依赖协调问题,支持复杂项目。
首个基于 MCP 架构的低代码 RAG 框架
检索增强生成系统复杂度提升,科研人员面临高昂工程成本。清华大学等联合推出 UltraRAG 2.0,基于 MCP 架构,降低复杂 RAG 系统技术门槛与学习成本,支持低代码构建复杂系统。
Claude团队大揭秘!如何调动多智能体搞深度搜索
Claude团队分享用多智能体构建深度搜索的心得,展示有效多智能体研究系统架构,涵盖系统架构、提示工程、评估方法等内容,还提及系统面临的问题、挑战及额外建议。
短视频刷多了AI也会变蠢!“年度最令人不安的论文”
最新研究显示,大模型灌多垃圾内容会‘脑损伤’,研究人员用不同维度定义垃圾数据并训练模型,测试其核心能力,发现垃圾数据致认知下降,且损伤不可逆,还给出行业启发。
阿里刚刚开源了一款影视级配音项目,口型同步、音色转换都不是事!
阿里通义实验室语音团队联合中科大发布多模态电影配音模型Fun - CineForge,开源模型并构建中文电视剧配音数据集。它能处理多种场景,有视频理解等亮点,还给出制作数据集步骤。
航空发动机用上大模型:解决复杂时序问题,性能超越ChatGPT-4o实现SOTA|上交创智复旦
上海交通大学李元祥教授等团队提出ITFormer架构,构建EngineMT-QA数据集。ITFormer能融合时序数据与大语言模型,适配多种编码器和模型,在EngineMT-QA预训练后达SOTA水平,实现高效数据分析。
今天,被GLM-5的Agentic Coding能力惊艳到了
上月底Anthropic报告揭示编程趋势转变,月初Claude Opus 4.6与GPT - 5.3 Codex发布印证。作者深度测试GLM - 5,经两项实测挑战,发现其在复杂系统任务表现超预期,有‘系统架构师’思维。
当机器人学会「看」和「说」之后,如何让它们真正拥有「手感」?
今年四月,戴盟机器人联合多家机构发布含触觉全模态具身数据集 Daimon-Infinity 并开源 10000 小时数据。IEEE 与戴盟联合创始人王煜教授深度对话,探讨触觉感知对机器人技术格局的影响、具身机器人落地场景等问题。