大数据任务」共找到 7722 篇相关文章

新闻资讯8

20万人抢的全球模型第一股,我中签了

智谱在港交所上市成全球模型第一股,作者申购中签。智谱专注AI Coding,迭代快,GLM - 4.7成绩亮眼,商业化数据佳,还有诸多有意思细节,虽行业竞争,但它表现不错。

花叔
算法论文8

模型化身苏格拉底:通过主动提问挖掘人机协作的深度

微软与南加州学联合团队研究揭示激发模型主动提问能力新范式。通过定义主动信息收集任务、提出强化微调策略,经实验验证该方法有效,使模型在多领域表现出色,重新定义模型角色。

AIGC开放社区
算法论文8

链式思维是幻象吗?从数据分布视角重新审视模型推理,马斯克回复,Grok破防

亚利桑那州立学研究发现,思维链(CoT)推理可能只是对训练数据分布内模式的复现,输入与训练数据分布有差异时,推理链条会失效。研究探究了CoT泛化性等问题,对实际应用提出警示。

机器之心
产品应用8

杭州跑出的AI独角兽,突围模型的“第二战场” | 甲子光年

2025年AI行业有转变,算力堆叠对语言模型性能提升放缓,空间智能成“第二战场”。谷歌、英伟达等巨头纷纷布局,群核科技作为杭州“变量”,发布业界首个3D室内空间模型,构建数据飞轮,技术有望落地多领域。

甲子光年
算法论文8

伯克利联手“拷问”模型:最强Agent也才40分!新基准专治“不听话”的AI分析师

与伯克利团队推出IDA - Bench新基准,模拟真实数据分析场景,解决现有基准无法评估模型在动态交互中可靠性的问题。测试显示,顶尖模型成功率最高仅40%,不同模型还暴露多种问题。

量子位
算法论文8

模型转行土木工程!首个「打灰人」评估基准:检验读、改工程图纸能力

首个工程自动化任务评估基准DrafterBench,可测试模型在土木工程图纸修改任务中的表现。它模拟真实工程命令,考察模型四方面能力。评测发现主流模型有一定能力,但未达工程一线要求。

新智元
算法论文7

剑桥揭开模型翻车黑箱!别再怪它不懂推理,是行动出错了

剑桥学等机构研究指出,模型执行长时任务易翻车,问题不在推理而在执行能力。研究人员评估多个指标,发现单步准确率提升可让任务长度指数增长,还研究了自条件化等影响及模型规模的作用。

新智元
新闻资讯7

凭借 27 万小时真机数据,Generalist 可能是最接近“GPT-1 时刻”的顶级机器人团队

Generalist是机器人领域有潜力的公司,凭借27万小时真机数据或达GPT - 1量级,领先6 - 12个月。团队成员来自顶尖机构,技术强,demo展示出模型灵巧性。不过也面临Scaling Law不确定、数据缺口、商业化场景缺失等风险。

海外独角兽
开源动态8

企业级OpenClaw最强拍档来了!万亿参数的国产多模态模型,刚刚开源发布

YuanLab.ai团队开源源Yuan3.0 Ultra多模态基础模型,是万亿级开源多模态模型之一。它优化训练效率,在多任务表现突出,为企业Agent AI提供支撑,还提出新算法和训练策略,全面开源推动落地。

量子位
推荐文章8

10万引普林斯顿刘壮最新访谈:架构没那么重要,数据才是王道

普林斯顿学助理教授刘壮在访谈中指出,架构没那么重要,数据、规模和记忆才是决定AI成败的关键。他认为ConvNet和Transformer性能差异源于训练细节;当前数据集远不够多样;语言模型有语言空间的世界模型,但视觉空间的还缺失;记忆是瓶颈,智能体只是权宜之计;AI目前还替代不了研究生。

量子位