大模型安全评测」共找到 8381 篇相关文章

新闻资讯7

爆冷!字节Seed 在CCPC 决赛只做出一道签到题,而DeepSeek R1 直接挂零?

第十届 CCPC 举行,字节 Seed 携 Seed - Thinking 参赛,结果意外,仅做出一题,DeepSeek R1 挂零。不同模型架构表现差异不大,暴露出大模型做算法题短板,推理模式表现更好。

InfoQ
推荐文章8

直播预约 | Evaluation论文分享@ICML&ACL2025

2025年6月11日20:00将直播分享Evaluation论文。多位嘉宾参与,涉及SyncPL奖励建模、文本事实一致性验证、大模型评测方法等多领域论文,涵盖模型优化、基准测试等内容。

深度学习自然语言处理
推荐文章7

个体如何实现主权AI

文章指出越依赖AI,越要考虑‘主权AI’问题。对个体而言,实现主权AI核心是掌握自身数据等,能随时换底层模型,还介绍积累的四类资产、微调顺序及现实路径。

newtype AI
新闻资讯9

The Batch: 981 | Ox Alpha 被揭晓为 GLM-5.3-Flash

本文是DeeplearningAI The Batch专栏的AI行业资讯,揭秘此前匿名上线爆火的Ox Alpha模型,公开其为Z.ai推出的GLM-5.3-Flash,详细介绍该模型的架构、性能、定价与授权信息。

DeeplearningAI
产品应用8

2026 年全民养虾,但你养的,到底是谁的虾?

OpenClaw开源引发全民养虾热潮,但多数数据跑在大厂云上。面壁智能推出EdgeClaw Box,适配多款硬件,有本地模型,能断网干活,具安全机制,省钱且技能丰富,还与OpenClaw互补。

AGI Hunt
推荐文章7

从零开始200行python代码实现LLM

文章从传统思路出发,用Python实现极简大语言模型,介绍从零基础到Bigram模型的过程,包括词汇表、模型训练推理等内容,还讲解了PyTorch基础,最后实现pytorch版Bigram模型,后续将实现完整GPT。

阿里云开发者
算法论文8

Skills刚火,就有零Skill的Agent来了…

Skills爆火之际,云玦科技团队提出不用Skills的零Skill Agent。它以Gemini 3 Pro为后端,在多个评测集表现出色。采用原位自进化框架,开源且成本低,或助力开源模型弯道超车。

量子位
新闻资讯8

OpenAI 推出 gpt-realtime:语音智能体进入“秒回”时代,开发者直呼交互更自然

OpenAI 发布语音对语音模型 gpt - realtime,开放 Realtime API。其结合可端到端处理语音,缩短响应时间。模型语音质量、理解能力、函数调用能力提升,API 全面升级,多家企业已试点,还强化了安全措施。

InfoQ
新闻资讯7

用得越多、失业越快?GitHub 大改 Copilot 规则:默认拿个人代码训练 AI,还搬出 Anthropic 挡枪!

当地时间3月26日,GitHub宣布自4月24日起,Copilot Free、Pro和Pro+用户交互数据默认用于训练改进AI模型,但用户可手动退出。它称此举因模型需更多数据,还拿微软等挡枪,却遭开发者吐槽。

InfoQ
开源动态8

国产开源LLM迎来大爆发的一周:Kimi、腾讯、快手、美团、面壁智能

国产开源大模型迎来爆发,快手、月之暗面、美团、面壁智能、腾讯等接连发布新模型,如快手Keye-VL - 1.5 - 8B刷新视频理解SOTA,美团LongCat - Flash - Chat推理快成本低等。

PaperAgent