训练评估体系」共找到 3206 篇相关文章

新闻资讯8

只剩5年?诺奖得主Hassabis放出AGI时间表:还差一两个技术突破

诺奖得主、Google DeepMind掌门人Demis Hassabis给出AGI终极时间表,认为5年内或需1-2项重大技术突破就能跨越障碍。他指出大模型有局限,实现AGI需“世界模型”和“智能体系统”,还称AI将加速科学发现,中国AI模型距美国仅差数月。

新智元
新闻资讯8

驾驭AI的人,才是穿越周期的竞争力|2026极客时间DTDS大会圆满落幕

2026年5月极客时间企业版联合《培训》杂志举办DTDS大会,四位产业一线实践者拆解企业AI转型难题。协鑫科技张诗笳给出AI人才培养体系;赵钰莹发布8大岗位AI技能图谱;广新集团李志刚分享创新加速三步法;黄林给出未来趋势判断与诊断模型。

InfoQ
开源动态8

社区供稿丨Jina-VLM:可在笔记本上跑的多语言视觉小模型

Jina AI发布2.4B参数量的视觉语言模型Jina - VLM,在多语言视觉问答任务达SOTA。它引入注意力池化,连接视觉与语言基座,处理问答等任务,对硬件要求低,多项测试表现优,还介绍架构、训练策略和上手方式。

Hugging Face
推荐文章8

为什么说多模态是推荐系统破局的关键?来自饿了么一线的实战复盘

文章围绕多模态推荐展开,从传统推荐算法演进到多模态表征技术,结合饿了么场景实践,还探索生成式推荐。介绍多模态推荐挑战与代表性工作,梳理表征技术发展,详述饿了么系统设计与训练,分析生成式推荐方案及业界路线。

阿里云开发者
推荐文章8

对话际数科技联创:质量赛道的先驱者,要做空间数据的「精炼厂」

本文是对际数科技三位联合创始人的访谈。在具身智能时代数据采集火热但数据荒严重背景下,际数关注数据质量,其以测绘背景为底气,用‘一张图、一把尺、一个飞轮’搭建技术护城河,打造质量因子库,还创新训练质量模型,有稳定商业路径。

机器之心
产品应用7

出了两道真题考 GLM-5.2,Opus 4.8 和GPT 5.5 陪跑

作者对GLM - 5.2、Opus 4.8和GPT 5.5进行两项测试。一是审计Skill体系,GLM - 5.2覆盖skill数多、找出冲突多,还挖出bug;二是做世界杯夺冠推演器网站,Opus表现出色,GLM - 5.2省token,Codex有巧思但结构有缺陷。

AI产品黄叔
新闻资讯7

Sora 2 惊现 LLM 推理能力,视频生成模型也能搞推理?

Sora 2在科学推理基准测试中获55%成绩,虽不敌GPT - 5,但一个视频生成模型能做推理令人惊讶。Epoch AI实验发现其可能借LLM重写提示词答题,网友也证实背后或有GPT - 4o等处理。此外,Google研究显示视频模型经大量训练或有推理能力。

AGI Hunt
开源动态7

Unsloth-MLX:在Mac上微调LLM,代码无缝迁移到云端GPU

对于Mac用户,在原型实验阶段反复租云端GPU是资源浪费。开发者推出Unsloth - MLX,基于MLX框架,让Mac用户本地高效微调大模型,改一行导入语句就能无缝迁移代码到云端,还介绍项目特点、状态等。

AI工程化
算法论文8

Anthropic让AI先读员工手册再上岗:失控率从54%降到7%

Anthropic最新研究「模型规范中期训练」(MSM)显示,相同训练数据配不同行事原则,模型表现不同。MSM在预训练和对齐微调间加中间阶段,让模型读规范文档理解准则,在特定实验中,将Agent失控率从54%降到7%。

新智元
开源动态8

LeCun的世界模型单GPU就能跑了

LeCun世界模型有新进展,开源极简训练方案LeWorldModel,单GPU就能跑,基于JEPA架构,速度快、参数小、控制强且懂物理,完胜此前JEPA方法,训练更简单。

量子位