「有毒数据」共找到 2481 篇相关文章
前 DeepMind 研究员反思:评测,而非算力或数据,才是下一阶段的瓶颈
前 Google DeepMind 高级研究员 Lun Wang 在技术长文中指出,当前主流评测体系滞后,静态基准会“安静失效”。作者主张引入序参量,呼吁构建自演进评测,还为一线工程师提供了研发建议。
字节跳动:Apache Doris + AI 一站式融合数据引擎的探索与实践
本文整理自字节跳动 DataMind 负责人演讲,介绍了基于 Apache Doris 打造的一站式引擎 DataMind。它集成 Hybrid Search、AI Function、GraphRAG 等能力,部分成果已贡献开源,还给出企业级 AI 问数落地方案。
535B大模型“直播”训练三个月:代码、数据、Loss全公开,吴恩达公开力挺
当多数模型公司还在争论是否开放权重时,斯坦福大学的Marin项目启动535B-A23B模型训练,并公开训练过程。该项目旨在探索基础模型能否像开源软件一样被公开研究和建设,引发关注。
全球首款!Claude引发的数据恐慌,被这家中国黑马补上了
威努特作为网络安全公司跨界推出AI桌面助手WinClaw。它能读懂各类文件并进行向量化处理,有多种检索方式,还能跨文档归纳、关系推理。具备安全的三层防护,支持双平台,注册即可用。
阿里巴巴 & 蚂蚁 LoongSuite GenAI 可观测语义规范:从统一数据语言到规模化落地
随着GenAI发展,OpenTelemetry推动语义规范建设。阿里巴巴与蚂蚁联合推出LoongSuite GenAI SemConv,在OTel基础上增强,新增Entry/Step Span、Skill语义、Token级推理观测,还推出GenAI Utils简化插桩开发。
Swiggy 内部 AI 助手升级:Text-to-SQL 不够用了,Agent 开始接管数据分析
Swiggy 推出基于生成式 AI 的 Text-to-SQL 助手 Hermes V3,运行在 Slack 中。它解决了旧版本问题,通过向量提示检索等升级,将 SQL 生成准确率从 54% 提至 93%,还增加会话记忆、解释层,与现有体系深度整合。
谷歌放大招!Gemini「吞下」2.5亿地图数据,路痴AI一夜成精
谷歌推出「Grounding with Google Maps」功能,让Gemini接入Google Maps,可调用2.5亿地点信息。本次更新拓展了AI能力边界,适用于多领域,部分Gemini模型支持,还介绍了使用示例。
管你模型多大,250份有毒文档统统放倒,Anthropic:LLM比想象中脆弱
Anthropic等联合研究打破传统观念,只需250份恶意文档就能在参数规模从6亿到130亿的LLM中植入后门,且与模型规模及训练数据量无关。研究还测试了特定后门攻击,评估了多种训练配置。
高盛研报:AI时代最大瓶颈不在算法和数据,而在电力和资本
高盛《Powering the AI Era》报告指出,AI是基础设施革命,其最大瓶颈是电力和资本。如一座250MW数据中心成本达120亿美元,2030年全球数据中心电力需求将激增,还介绍了应对办法及相关细节。
19.8K star!一款开源可视化工作流调度项目,轻松搞定大数据任务!
Kestra 是开源工作流编排平台,用于处理复杂任务自动化问题。它跑在 JVM 上,用 YAML 配置,支持插件扩展。适用于多种任务调度场景,有配置简单、稳定、容错等特点,安装也容易。