「海外训练模型」共找到 8161 篇相关文章
刚刚,OpenAI找到控制AI善恶的开关:ChatGPT坏人格在预训练阶段已成型
OpenAI最新论文揭示控制AI“善恶”开关。研究发现训练模型在某领域答错题,会致其在其他领域“学坏”,还找到“毒性人格特征”。同时给出解决办法,能让模型恢复正常。
王兴一鸣惊人!美团首个开源大模型追平DeepSeek-V3.1
美团首个开源大模型Longcat-Flash-Chat发布即引发热议。它在部分benchmark上超DeepSeek-V3.1等,编程能力也出色。技术报告透露美团对大模型的理解,还有新发现,且性能好、训练效率高。
沉寂一个月,openPangu性能飙升8%!华为1B开源模型来了
华为发布专为昇腾端侧硬件打造的openPangu Embedded - 1B模型,仅10亿参数却性能卓越。它运用多阶段训练和优化,在权威基准表现亮眼,V1.1平均分较上月跃升超8%,还介绍了背后技术。
阿里又上新!开源 7B 文生图模型,专治图中文字,效果媲美 20B+ 大模型!
阿里 AIDC - AI 团队开源 7B 参数文生图模型 Ovis - Image,主打图中文字生成。它文本渲染能力强,在权威榜单成绩好,媲美 20B + 大模型,官方还提供使用方法,是设计类刚需模型。
啊?微博7800美元训的大模型,数学能力超了DeepSeek-R1
近日,微博发布自研开源大模型VibeThinker,15亿参数却在数学测试上击败6710亿参数的DeepSeek R1,后训练成本仅7800美元。其为AI产业带来新思考,还将推动微博AI应用发展。
Altman 秀新模型“翻车”,谷歌补刀躺赢!OpenAI 前员工爆肝3天,编程再赢老东家模型!
近期 OpenAI 多款未发布新模型登场,一款疑是“伪装的 GPT - 5”,一款编程赛获第二。宣称在 IMO 获金牌的模型遭质疑,谷歌 DeepMind 同获金牌评价更好。OpenAI 前员工编程赛赢老东家模型。
腾讯提出Vision-SR1:让模型真正学会“看图思考”,而不是“蒙答案”
视觉语言模型(VLMs)存在视觉幻觉和语言捷径问题,限制其可靠性和泛化能力。腾讯提出Vision - SR1训练方法,通过推理分解和自我奖励机制,不依赖外部监督,提升模型视觉感知和推理可靠性。
可能是目前效果最好的开源生图模型,混元生图3.0来了
腾讯混元发布并开源原生多模态生图模型混元图像3.0,参数规模80B,是参数量最大的开源生图模型,也是首个开源工业级原生多模态生图模型,效果对标业界头部闭源模型。文中介绍其技术方案、测评效果等。
EMNLP 2025 | CARE:无需外部工具,让大模型原生检索增强推理实现上下文高保真
MetaGPT等机构团队发布CARE框架,可让LLM将推理上下文与自身检索能力结合,已全面开源。它提出原生检索增强推理范式,采用两阶段训练策略,在问答基准实验中表现出色,为解决模型问题提供新路径。
大模型“记性差一点”反而更聪明!金鱼损失随机剔除token,让AI不再死记硬背
马里兰大学等团队提出金鱼损失法,训练时随机剔除部分token,让模型不逐字记内容,仍学语言规律。实验显示,LLaMA - 2用该方法后记忆内容减少,下游任务性能影响小。