标准分」共找到 938 篇相关文章

新闻资讯8

字节发布全球首个预测未来基准FutureX,Grok-4 拿下冠军

字节跳动发布全球首个实时未来预测基准测试FutureX,杜绝模型作弊。在25个模型评测中,Grok - 4夺冠。它从多网站构建问题,四级难度。人类专家在部等级仍领先AI 。

AGI Hunt
开源动态8

扣子官宣开源,掀桌大动作背后如何决策?扣子负责人独家披露

7月26日,字节将AI Agent平台「扣子(Coze)」旗下Coze Studio与Coze Loop开源至GitHub,采用Apache 2.0许可证。文章披露开源决策背后故事,探讨开源版目标、定位,以及团队对Agent开发未来的思考。

InfoQ
新闻资讯7

马斯克Grok的AI男友还在取名,开源版AI女友已经火了,还是3D的

前几天Grok推出‘智能伴侣’功能,马斯克在线征集男性Grok数字伴侣命名。网友Jackywine复刻出3D版开源AI女友‘Bella’,介绍了其工作流、愿景及规划的‘AI原生’演进路径。

机器之心
算法论文7

一篇持续强化学习技术最新综述

文章对持续强化学习(CRL)进行全面考察,关注其核心概念、挑战和方法,提出新的类体系,从知识存储和/或转移角度将CRL方法为四类,并别介绍各类方法特点。

PaperAgent
推荐文章7

揭秘大模型评测:如何用“说明书”式方法实现业务场景下的精准评估

文章系统性介绍业务场景下大模型评测流程,包括需求析、评测集设计生成、维度设定、任务执行和报告输出。指出评测挑战,如设计维度和集,还给出评测方法及案例,像蚂蚁评测集、业务自动化评测。

阿里云开发者
推荐文章8

11Labs 增长负责人:搞营销要学着做视频,但创始人出镜会有点自恋

AI语音独角兽ElevenLabs增长迅猛,估值超30亿美元。其增长负责人Luke Harries享独特策略,如业务单元管理、重视视频营销、多渠道推广等,还给出团队搭建、产品发布等实用建议。

Founder Park
产品应用8

别再手搓测试数据了!AE测试数据智造系统揭秘

本文介绍基于大语言模型的AE测试数据智造Agent,解决AliExpress跨境电商测试数据构造难题。它结合大模型与原子工具库,实现自然语言驱动的全链路测试数据生成,提升测试效率与智能化水平。

阿里云开发者
新闻资讯7

腾讯打出「AI岗位薪酬不限」的底气来自哪?

毕业季AI专业毕业生择业有疑虑,AI下半场竞争重心转移。腾讯覆盖领域广、业务耦合强、有变现案例,契合AI下半场人才成长环境,其青云计划“薪酬上不封顶”,今年筛选标准升级。

机器之心
产品应用7

SQL玩转多模态AI,轻松搞定图片+文本混合搜索

在AI驱动智能商业时代,传统搜索系统难满足需求,AI检索系统又面临数据搬运和工具链割裂难题。本文提出用原生SQL实现多模态智能检索,基于PolarDB融合AI引擎,通过SQL调用服务,无需迁移数据与搭建独立服务。

阿里云开发者
算法论文7

一文解读 LLM Posting-Train技术

文章解读了大语言模型后训练(Post-training)技术,介绍其核心价值,从微调、强化学习、测试时拓展三方面展开,析现有技术瓶颈,指出前沿研究方向,还给出实践指南和工具链推荐。

海边的拾遗者