职场测试」共找到 2049 篇相关文章

新闻资讯7

OpenAI与Anthropic罕见合作:竞争对手联手测试AI安全

OpenAI和Anthropic完成联合评估,用内部工具测对方模型并公开结果。测试覆盖指令层级、越狱等四大领域,还发现不少细节和道德困境情况。此次合作意义重大,为行业树立安全合作先例。

AGI Hunt
新闻资讯7

波士顿动力机器狗侧空翻炸!穿轮滑鞋照样能翻

风头被中国机器人盖过的波士顿动力,让机器狗Spot完成侧空翻等动作。工程师称它并非为空翻设计。空翻是严苛测试手段,能验证系统性能,还透露了训练细节,此外它还将上《美国达人秀》。

量子位
开源动态8

NVIDIA 开源 Live VLM WebUI:摄像头实时测试视觉语言模型

NVIDIA 开源 Live VLM WebUI,可让用户在本地用摄像头实时测试视觉语言模型。它基于 WebRTC 技术,能将摄像头视频流实时传输给模型,分析结果叠加在画面上,支持多后端、多平台及多种模型。

AI工程化
新闻资讯8

刚刚,AI科学家Zochi在ACL「博士毕业」,Beta测试今日上线

Intology宣布AI科学家Zochi论文被顶会ACL主会录用,成首个独立通过A*级别会议同行评审的AI系统,还开放Beta测试。其研究成果显示语言模型安全措施或有不足,Zochi工作成果多且质量高。

机器之心
开源动态8

顶尖AI竟输给三岁宝宝,BabyVision测试暴露多模态模型硬伤

UniPat AI 等发布多模态理解评测集 BabyVision,测试显示多模态大模型纯视觉能力仅达三岁幼儿水平。其通过对比实验、细分任务评测,揭示模型系统性缺基础视觉能力,还给出新方向及发展建议。

AINLPer
开源动态7

FACTS 基准测试套件问世,用于评估大型语言模型的事实准确性

FACTS 基准测试套件由 FACTS 团队与 Kaggle 联合开发,基于原 FACTS Grounding Benchmark 增加三个新基准,可从四个维度评估大模型事实性。初步结果显示进展与挑战并存,多模态成难题。

InfoQ
新闻资讯7

DeepSeek-R2!?神秘模型惊现竞技,真实身份引网友猜测

大模型竞技秘密上线神秘模型steve,对话中它称来自DeepSeek。网友热烈讨论其身份,有R2、V4等猜测。同时,因CEO不满及可能缺芯片,DeepSeek的R2再度延期。

量子位
推荐文章8

高中辍学,22岁入OpenAI成为「研究科学家」,他是怎么做到的?

文章讲述22岁高中辍学的Gabriel Petersson入OpenAI成为研究科学家的故事。对比传统学习路径,介绍他自顶向下的学习法,分析其可行原因、适用景,还给出行动建议,指出学位价值在改变。

花叔
算法论文8

Anthropic、Thinking Machines Lab论文曝光:30万次压力测试揭示AI规范缺陷

Anthropic和Thinking Machines Lab等机构研究人员提出模型规范压力测试法,基于细粒度价值体系生成超30万个查询景,分析12个前沿大模型回答,揭示模型规范存在原则冲突、解释歧义等缺陷。

机器之心
新闻资讯8

GPT-6 Astra发布,多个基准测试接近满分,“欢迎来到AGI时代”?

当地时间9月3日,OpenAI发布GPT-6 Astra,称其为“最智能、最对齐”的模型。它在多测试表现逆天,能力提升显著,还加入新特性。不过价格更高,也带来安全问题。

DeepTech深科技