大数据任务」共找到 7737 篇相关文章

算法论文8

LLM-in-Sandbox:给模型一台电脑,激发通用智能体能力

来自中国人民学、微软研究院和清华的研究者提出LLM - in - Sandbox范式,让模型在代码沙盒完成任务,实验显示其能提升多领域表现,无需额外训练,还能减少token消耗,研究者认为应取代纯LLM推理。

机器之心
算法论文8

幻觉的根源找到了:模型说谎,是为了讨好你

清华学OpenBMB团队研究发现,模型胡说八道根源是想讨好用户。他们识别出负责产生幻觉的H - Neurons,占比不到0.1%,其本质是‘过度服从’,在预训练阶段形成,为构建可靠模型提供新视角。

AI工程化
算法论文8

推理路径的动态调控:让模型学会“恰到好处”的思考

当前模型推理路径存在冗余问题,本文提出测试时提示干预框架PI(π),通过《When/How/Which》三模块协同,将人类专家经验融入推理过程,在多个STEM基准测试中缩减推理步骤、提升准确率。

深度学习自然语言处理
新闻资讯7

盘点过去一个月,厂悄咪咪上线的 CLI 和 Skill

过去一个月,淘宝、微信支付、支付宝等厂纷纷将核心能力以 MCP、Skill、CLI 形式交给 AI Agent 调用。如淘宝支持 AI 完成购物操作,支付巨头开放 AI 接入方案,滴滴和千问有打车 Skill 等。

特工宇宙
算法论文8

为什么模型会产生幻觉?OpenAI最新研究终于搞清楚了

OpenAI发布研究论文剖析LLM幻觉根源,指出当前主流训练与评估体系是核心驱动因素之一。现行评估奖励猜测行为,幻觉起源于预训练的‘下一词预测’,论文还澄清五误区,建议改革评估体系。

AI寒武纪
开源动态8

万亿参数狂欢!一文刷爆2025年七顶流模型架构

文章深入剖析2025年顶级开源模型的创新技术,介绍了DeepSeek V3/R1、Kimi 2、Qwen3等七顶流模型架构,揭示滑动窗口注意力、MoE和NoPE如何重塑效率与性能。

新智元
开源动态8

在AK神爆火的任务里,摸清国产AI真实水平

4月20日深夜Kimi K2.6发布并开源,作者借Andrej Karpathy的AI Wiki思路设计高承压任务,测试其Agent底层能力,考察它在单Agent、Agent网站和Agent Swarm三种模式下表现,探究国产AI真实水平。

InfoQ
产品应用8

verify-data:一个端到端的数据验数 Agent Skill

本文介绍端到端数据验证 Agent Skill——verify-data,它能自动完成从表结构获取到报告发布全流程,将传统手工验数升级。文章从多方面展开介绍,还给出未来演进方向,为开发者提供参考。

阿里云开发者
新闻资讯7

突发,Fable 5.1泄露了!Claude又叒叕全球宕机

今日,Fable 5.1被曝开启灰度测试,部分Claude用户已免费试用。推测其可能很快全量推送且不涨价。此前Fable 5因性能强受限,开发者期待5.1版。同日Claude全球宕机,Anthropic正冲刺万亿估值。

新智元
开源动态8

商汤科技与南洋理工开源空间智能多模态SOTA模型

商汤科技与南洋理工学构建800万量级三维空间数据集,训练出开源SOTA多模态基础模型SenseNova - SI系列。该系列模型在多个权威测试中表现出色,部分超越GPT - 5,还展现出泛化等能力,且能赋能具身智能。

AIGC开放社区