超参数调优」共找到 2664 篇相关文章

开源动态8

图像界的DeepSeek!12B参数对标GPT-4o,5秒出图,消费级硬件就能玩转编辑生成

Black Forest Labs开源旗舰图像模型FLUX.1 Kontext[dev],专为图像编辑打造,能在消费级芯片运行。12B参数少、推理快,性能媲美闭源模型。有诸多特点,经优化训练,在KontextBench基准表现优。

量子位
算法论文8

Qwen3-VL-Seg 深度解读:当多模态大模型学会"像素级精准手术",仅用0.4%参数碾压8B模型

文章深度解读阿里通义实验室发布的Qwen3-VL-Seg,它解决开放世界指代分割问题,用仅17M参数(占基础模型0.4%)在4B规模越8B模型。介绍其原理、架构、数据、实验结果,还给出实战代码。

机器学习AI算法工程
新闻资讯7

创始人自曝让儿子辍学用AI上课、水平同龄人!俞敏洪最先押注的“AI学校”,负债9亿不垮、现在要开到美国了

松鼠Ai创始人栗浩洋让儿子辍学用AI上课,称其水平同龄人。该公司获俞敏洪投资,曾负债9亿,后转型靠学习机业务发展。现计划将“AI学校”开到美国,适配当地市场并回应数据安全顾虑。

InfoQ
产品应用8

马斯克挖不动的清华学霸,一年造出 “反内卷 AI”!0.27B参数硬刚思维链模型,推理完爆o3-mini-high

新加坡Sapient Intelligence推出小参数AI模型HRM,能解决复杂推理难题。它受大脑启发,提出“隐性推理”路径,准确率碾压先进思维链模型,推理能力越o3 - mini - high,经济性突出,任务效率可百倍提升。

AI前线
新闻资讯7

创始人自曝让儿子辍学用AI上课、水平同龄人!俞敏洪最先押注的“AI学校”,负债9亿不垮、现在要开到美国了

松鼠Ai创始人栗浩洋让儿子辍学用AI上课,称其水平同龄人。该公司由俞敏洪最早投资,曾负债9亿,后转型推出学习机业务。如今计划将‘AI学校’开到美国,正做相应市场适配调整。

AI前线
开源动态8

刚开源的口袋级TTS,CPU 即可多语言本地畅用,爽!

传统TTS模型对个人开发者和边缘设备不友好,最近Github上开源的Pocket - TTS仅100M参数,能在普通CPU上实时语音合成,支持语音克隆,安装简单,适合多种本地语音开发场景。

开源先锋
算法论文8

这个AI精准模拟人类行为大脑状态,上Nature了

德国团队开发出人类认知通用计算模型Centaur,登上Nature。它基于Llama 3.1 70B,用5天训练,参数仅Llama的0.15%,能模拟人类在160项实验中的行为,性能传统模型。

量子位
开源动态8

2天1k多星!BAGEL横空出世:字节跳动发布全球首个多模态全能AI,开启智能新纪元!

字节跳动推出开源多模态基础模型BAGEL,有70亿活跃参数。它在多模态理解排行榜顶尖开源模型,文本到图像质量与SD3媲美,还具备世界建模等能力,文中介绍其方法、特性及使用说明。

GitHubStore
算法论文8

谷歌Transformer过时了?清华姚班校友等三连击,爆改注意力!

谷歌提出新架构,参数减少40%,训练速度较RNN提升5 - 8倍,某些任务性能Transformer 7.2%。新架构引入注意力偏向策略,用「保留」取代「遗忘」,还提出Moneta、Yaad、Memora三个新模型,在多任务上表现卓越。

新智元
开源动态8

字节Seed新方法!开源8B代码模型:自己筛数据训练自己,同量级SoTA,还能越百亿级对手

传统code大模型依赖人工筛选数据,成本高、效率低。而Seed - Coder团队让LLM自己筛选数据训练自己,打造8B参数轻量级开源代码模型,性能百亿级对手,不过也存在通用和数学能力短板。

深度学习自然语言处理