技能评估」共找到 1021 篇相关文章

新闻资讯7

谷歌约战,DeepSeek、Kimi都要上,首届大模型对抗赛明天开战

太平洋时间8月5 - 7日,8款前沿AI模型将在Kaggle Game Arena展开为期3天的国际象棋比赛,参赛方都是AI界顶流。谷歌称现有基准测试难跟上模型发展,这场比赛是探索新评估方法。赛制为单败淘汰制。

机器之心
开源动态8

突破具身智能任务规划边界,刷新具身大脑多榜单SOTA,中兴EmbodiedBrain模型让具身大脑学会「复杂规划」

当前主流大语言模型在具身任务场景面临瓶颈,中兴星云大脑团队推出具身视觉 - 语言基础模型 EmbodiedBrain,构建全流程创新框架,在架构、数据训练、评估体系等方面有突破,还将开源成果推动生态发展。

机器之心
新闻资讯7

AI教父Hinton警告:有志于编程,不必读大学!

新智元报道,AI教父Hinton等警告AI正在颠覆编程岗位,美国超1/4编程职位已消失。探讨大学是否还应教编程、CS是否值得学,还提及程序员求职难等现状及未来技能需求趋势。

新智元
新闻资讯8

Anthropic最新经济指数:AI让高学历任务提速12倍,但也可能让你的工作“降级”

Anthropic通过‘经济指数’项目,对Claude.ai和其API对话分析。最新报告引入‘经济基元’,基于2025年11月样本分析,揭示AI对任务、职业和总体影响,如让高学历任务提速12倍,也可能致岗位‘技能降级’。

AI寒武纪
算法论文8

从繁杂技巧到极简方案:ROLL团队带来RL4LLM新实践

当前RL4LLM领域发展快但存在标准、结论不一及机制解释不足等问题。阿里巴巴淘天集团和爱橙科技联合高校基于ROLL框架研究,评估关键技术组件,提出简化算法Lite PPO,在多基准上表现佳。

机器之心
推荐文章7

数据分析师如何快速建立在 AI 时代最值钱的能力:一份可落地的行动路线图

文章借Snowflake分享,探讨数据从业者在AI时代的核心能力。介绍AI从工具到执行者的进化,指出数据叙事成稀缺技能,还给出普通职场人90天AI逆袭路线图,强调人类在决策判断上的不可替代性。

InfoQ
开源动态8

腾讯混元推出首款开源混合推理模型:擅长Agent工具调用和长文理解

6月27日,腾讯混元开源首个混合推理MoE模型Hunyuan - A13B,参数80B激活仅13B,推理快性价比高。它在多测试集成绩好,尤其擅长Agent工具调用和长文理解,还开源两数据集填补评估空白。

AI前线
算法论文8

工具增强的多模态LLM综述

多模态大语言模型(如GPT - 4V)虽有强大图文理解能力,但受数据稀缺、复杂任务表现不佳和评估标准不统一限制。论文提出为MLLM集成外部工具,构建全景图,覆盖多维度,还指出挑战与对策。

深度学习自然语言处理
新闻资讯8

硅谷今日最热具身模型!不用后训练,看一遍就学会

北美具身初创Skild AI发布全新机器人基础模型S1,主打上下文学习,能看示范视频完成复杂操作。在未见过任务上成功率达66%,远高于传统方法。其发展或让开发机器人技能像给ChatGPT写Prompt。

量子位
算法论文8

AI里最大的Bug,却也是人类文明最伟大的起点。

OpenAI论文指出AI产生幻觉是因其训练方式奖励瞎蒙行为。以考试为例,AI在信息不足时猜测是最优策略。还从统计学解释根源,指出解决幻觉需改变评估指标,也引发对人类想象力起源的思考。

数字生命卡兹克