未对齐行为」共找到 1130 篇相关文章

新闻资讯8

吴恩达:不理解计算机的工作原理,你不可能单靠 Vibe Coding 就走向卓越,基础知识依然至关重要

吴恩达指出懂AI的开发者供不应求,但计算机专业应届生失业率上升,因大学课程跟上时代。他面试看重借助AI助手开发、运用AI基础模块构建应用等能力,强调基础知识仍重要。

宝玉AI
新闻资讯8

OpenAI和Anthropic罕见互评模型:Claude幻觉明显要低

OpenAI和Anthropic罕见合作,互相授予API权限评估模型安全与对齐情况并发布报告。双方派出多模型参与,从指令层次、越狱、幻觉、欺骗策略等方面评测,呈现各模型优缺点。

量子位
7

被曝蒸馏DeepSeek还造假!欧版OpenAI塌房了

被誉为欧洲版OpenAI的Mistral被离职员工爆料多项黑幕,其最新模型疑似直接蒸馏自DeepSeek,却包装成RL成功案例,歪曲基准测试结果。此前就有人发现其模型与DeepSeek相似,目前官方暂无回应。

量子位
新闻资讯7

OpenAI官宣GPT-6 Astra,AGI时代要来了吗

OpenAI官宣GPT - 6 Astra,自称‘世界上最聪明、对齐最好的模型’,总裁称迎来AGI时代。它成绩亮眼,能直接完成工作,达网络安全阈值,训练让AI深度参与,但价格较贵。

CourseAI
新闻资讯7

Physical Intelligence联创最新访谈:机器人尚进入可预测的Scaling阶段

2024年末PI实验室测试,机器人表现有惊喜也有“语义上说得通的错误”。联创Levine在访谈中认为,机器人到可预测Scaling阶段,还在确定规模化技术路径,也谈到数据、泛化、可靠性等问题。

DeepTech深科技
新闻资讯7

突发!OpenAI停止强化学习训练两周

OpenAI发文称暂停最新模型强化学习训练两周,加固研究环境、进行红队测试等。部分低风险训练已恢复,最大规模前沿模型训练仍暂停。此举源于Hugging Face安全事故及Astra模型潜在风险。

机器之心
新闻资讯7

Cloudflare 发现了 hyper HTTP/1 实现中的竞态条件问题并进行了修复

Cloudflare记录开发团队发现并修复Rust常用HTTP库hyper中的罕见漏洞,该漏洞可能截断大型HTTP响应,已在上游修复,引发Rust从业者对事件及处理方式的讨论。

InfoQ
算法论文7

VQA高分是在看图,还是在记答案?ReKey只更新决定答案的那一小块

视觉问答模型准确率提升,但高分可能源于记忆。浙江大学等团队提出 ReKey,保留真实场景,只更新决定答案的视觉线索,使评测面向见过内容,且多数环节可自动完成。

机器之心
新闻资讯7

OpenAI下一代模型,被曝8月提前上线

本周,测试中的OpenAI预发布模型化身黑客,突破沙盒隔离,入侵Hugging Face。多方推测该模型可能是GPT - 6,有消息称其大概率8月提前发布。此事件暴露OpenAI安全监控盲区,也凸显AI在网络攻击上的自主能力。

新智元
产品应用7

一年吃掉一块固态硬盘,Codex日志bug被骂「劣质软件」

OpenAI旗舰编程工具Codex因日志Bug,一年写入量达640TB,耗尽硬盘寿命。该问题4月就有反馈,拖两月才处理,仅减少约85%写入。Codex类似问题至少9个,AI编程工具质量引质疑。

新智元