「《数据空间探索与实践》」共找到 3431 篇相关文章
「0污染」LLM理解基准来了!20000道题14个学科全覆盖,来自微软
MMLU-CF是微软亚洲研究院推出的无污染多任务语言理解基准测试,含20000道题、覆盖14学科。通过去污染规则和闭源测试集防数据泄露,保证评估结果可靠,已在Huggingface开放。
刷新复杂Agent推理记录!阿里通义开源网络智能体超越DeepSeek R1,Grok-3
互联网信息检索中,复杂问题让普通开源模型力不从心。阿里通义实验室提出WebSailor方案,通过SailorFog - QA数据集和DUPO算法等创新,提升模型能力,在多基准测试中超越诸多开闭源模型。
40万次Claude Code会话实锤:这才是AI时代最值钱的本事!
Anthropic用40万次Claude Code会话数据得出结论,决定AI编程成败的不是代码功底,而是对行业的理解。人决定造什么,AI决定怎么造,懂行的人能从AI榨出几倍产能。
微软深夜送出程序员节最“离谱”的礼物:让Mico接管你的Copilot
2025年10月23日,微软发布“Copilot秋季发布版”,将Copilot升级为“情境AI基础设施”,更新12项关键功能,最瞩目是新增角色Mico。它能反映情绪,是微软人机交互探索的延续,引发网友讨论。
ChatGPT惊现“零点击攻击”,API密钥被轻松泄露,OpenAI暂未解决
ChatGPT存在“零点击攻击”安全问题,攻击者可通过向第三方应用文档注入恶意提示,窃取用户敏感数据和API密钥。OpenAI虽采取防范措施,但攻击者仍能绕过。专家为企业提出防范建议。
北航LiveRepoReflection: 扭转乾坤-仓库级代码反射
本文提出LiveRepoReflection基准,评估多文件仓库代码理解和生成能力,含1888个测试案例。创建RepoReflection - Instruct数据集训练RepoReflectionCoder,评估40多个LLMs,结果显示其能有效测模型反思修复能力。
告别评估乱象!首个视觉解释综合性基准发布,附人类真值 | KDD'25
埃默里大学团队推出首个视觉解释基准Saliency - Bench,构建8个任务的数据集,提供标准化评估流程与开源工具包,解决评估缺乏标准等问题,推动可解释AI向可靠、透明发展。
28岁辍学生掌舵Meta超级AI!小扎掷千亿,与奥特曼密谋,新「王」登顶
28岁的Alexandr Wang 19岁辍学,24岁成亿万富翁,现加盟Meta负责「超级智能」部门。他接受专访谈前沿思考,如智能体经济将至、人类成管理者、数据是瓶颈等,其理念有争议。
下一代mRNA药物是什么?由谁来定义?|对话深信生物李林鲜
本文对话深信生物李林鲜,回顾其从科研到创业经历。深信成立后经历mRNA产业起伏,从疫苗到治疗性产品推进。现探索用AI助力研发,李林鲜期望未来由深信定义下一代mRNA药物。
刚刚,SpaceX、英伟达宣布:AI数据中心要上天了
SpaceX与英伟达合作设计Starmind AI1卫星计算载荷,每颗卫星搭载NVIDIA GPU和CPU,将数据中心算力部署太空,该设计也用于地面数据中心。但项目投入大,还面临管理集群等难题。