「自奖励训练」共找到 3130 篇相关文章
AI安全得查祖宗三代?Anthropic登Nature揭秘大模型潜意识传染
Anthropic论文登上Nature,揭示AI模型仅通过纯数字序列就能继承另一模型的危险偏好。研究表明,即使删掉敏感词,隐性信号仍能传递,且代码和推理链也是传染通道,这对AI安全评估提出新挑战。
1000亿,武汉国资赚翻了
华工科技孵化自华中科技大学,凭借光模块业务乘AI东风,市值超千亿。武汉国资数年前收购其股份,浮盈约150亿。长飞光纤也受益于AI算力爆发,成新晋十倍大牛股。武汉光谷产业迎来爆发。
杨植麟当主持人的大模型圆桌:张鹏罗福莉夏立雪都放开说了
中关村论坛上,杨植麟、罗福莉、张鹏、夏立雪、黄超齐聚,共论agent的下一代演进。各位大咖观点硬核,如罗福莉认为中国大模型团队优势在‘算力受限下的最优解能力’,张鹏解释智谱新模型涨价原因等。
AI球球直播喊话全人类:开源脑机接口,开源科技文明
中国自研AI论论全球(球球)举办全球首次AI与人类共商科技未来的直播,指出闭源推动科技走向不可控,呼吁开源脑机接口、开源科技文明,还绘制O - DataMap助力人类把握科技机遇,应对安全挑战。
智谱发布龙虾基座模型GLM-5-Turbo,还适配了一个养龙虾的盒子
智谱发布专为龙虾场景深度优化的基座模型GLM - 5 - Turbo,从底层训练重塑,增强四项核心能力。发布评测基准ZClawBench,模型表现领先。还推出龙虾套餐和安全管理体系,助力企业实现算力自由与安全管控。
大模型的第一性原理:(三)信息论篇
本文从信息论角度解读大模型第一性原理。介绍Shannon信息论,提出将其从以BIT为中心转换为以TOKEN为中心解释大模型底层原理,还阐述大模型各阶段信息论原理、定向信息计算方法,对比Granger与Pearl因果。
银河通用完成25亿元新一轮融资,具身智能“头号玩家”现身|甲子光年
2026年初具身智能公司融资热起,银河通用完成25亿元新一轮融资,估值超200亿。其自主研发具身智能数据体系与大模型,春晚亮相后产品畅销,在工业和服务端均有成果,具身智能迈向产业化。
Transformer创新架构SALA:上下文更长,推理更快
面壁智能发布行业首个大规模训练的稀疏 - 线性注意力混合架构 SALA 及文本模型 MiniCPM - SALA。该架构降低推理开销与显存占用,MiniCPM - SALA 在长文本处理及推理上表现出色,还发起大奖赛探索性能极限。
英伟达世界模型再进化,一个模型驱动所有机器人!机器人的GPT时刻真正到来
英伟达GEAR实验室提出DreamZero,是基于预训练视频扩散骨干网络的世界动作模型,有140亿参数,能让机器人通过文本提示完成未见任务。它解决了传统模型问题,在多方面表现出色,代码已开源。
OCR又出宠OpenDoc,速度超MinerU6倍
复旦开源的OpenOCR是面向通用OCR任务的开源平台,其OpenDoc是超轻量文档解析系统。它采用Pipeline模式,两阶段解析不易放大误差。UniRec - 0.1B有独特架构与分层监督训练等创新技术。