训练效率」共找到 3071 篇相关文章

算法论文7

SRO架构赋予Qwen-2.5-VL推理能力,性能飙升16.8%

文本领域推理模型成就大,但扩展到多模态大语言模型遇阻力,如冷启动初始化不足等。为此提出 SRO 三阶段训练框架,经测试,ReVisual - R1 平均性能提升 16.8 个百分点。

CourseAI
新闻资讯7

Anthropic 发文称自家 Claude 已经开智,网友:为了上市,不择手段?

Anthropic发布Claude内部机制新研究,介绍J-space和J-lens,称可读取模型未输出的内部概念。此研究在训练、评测和部署有潜在价值,但叙事引发争议,网友质疑是否过度包装。

AI科技评论
开源动态8

中科院甩出多模态“核弹”!类GPT-4o多模态模型开源!支持语言-视觉-语音任意组合交互!

中国科学院计算技术研究所(ICTNLP)开源类GPT - 4o多模态模型Stream - Omni,支持文本、视觉和语音任意组合交互,核心是高效模态对齐技术,少量多模态数据即可训练,有多种使用场景。

开源星探
7

奥特曼怕了!GPT-5.5「大蒜」决战谷歌,红色警报紧急拉响

三年前ChatGPT让谷歌恐惧,如今OpenAI被谷歌逼得拉响‘红色警报’。OpenAI计划发布新推理模型,‘Garlic’预训练有突破,还启动下一代模型。OpenAI调整策略,聚焦提升ChatGPT体验。

新智元
开源动态8

Claude Mythos核心架构开源!22岁天才一人破解,融合DeepSeek思路

22岁初创CEO Kye Gomez以第一性原理推导出Claude Mythos核心架构,开源OpenMythos项目。该架构采用循环深度Transformer,不堆参数,循环思考16次推理,结合MoE层,参数效率翻倍。

新智元
产品应用7

既然 Claude 封了不让用,Codex 就疯狂追赶之

Claude 受限,作者转用 Codex 等 Agent 工具,效率不错。OpenAI 加大 Coding 投入,Codex 追赶势头猛。作者还分享 Codex 使用心得,介绍为 CatReader 加新功能过程,提醒加功能要谨慎。

MacTalk
推荐文章8

上交博士最新思考:仅用两个问题讲清强化学习

上交博士 Kun Lei 博客提出用两个问题理解强化学习:数据从哪来、策略更新多频繁。借此梳理算法逻辑,还延伸到机器人基础模型,指出训练节奏与其实践契合。

AI科技评论
新闻资讯7

这个叫STOP AI 的极端组织要求:立即销毁ChatGPT

Stop AI组织自称「非暴力公民抵抗组织」,发布政府诉求清单,要求禁止训练超10^12 FLOPs神经网络,销毁GPT - 4等模型,还提出多项激进诉求,引发网友热议。

AGI Hunt
推荐文章7

推荐!5分钟上手Chrome MCP,替代5个付费AI

作者测试发现Chrome MCP能替代大部分付费AI工具,如Cubox、音频工具等。它能让Claude控制浏览器,操作简单,1小时可配置,还能年省2000元,提升效率

AI 产品自由
产品应用8

刚刚,Thinking Machines出手!首款交互模型来了,翁荔出镜实测

Thinking Machines Lab推出首个大模型TML - Interaction - Small,打破传统人机交互模式,实现全自然交互。它训练范式独特,采用双模型架构等设计,评测表现超GPT - Realtime 2.0等模型,后续还会推出更大尺寸模型。

机器之心