低熵模型」共找到 8185 篇相关文章

产品应用7

实测 Seed 2.1 Pro:从零到一,开源一个大学生就业补贴的公益网站

火山引擎在 Force 大会发布豆包大模型 Seed 2.1 Pro 系列,API 上线火山方舟。作者实测用其完成大学生就业补贴政策网站开源项目,展示模型 Coding 和 Agent 能力,还提及性能、成本等优势及后续计划。

AGI Hunt
新闻资讯8

刚刚,OpenAI GPT-6 Astra震撼发布!AGI时代来了

OpenAI正式发布GPT - 6 Astra,总裁称已到AGI时代。该模型定位为“世界上最智能、最对齐的模型”,在多领域表现出色,能力强、速度快、成本,还具备“关键级”网络安全能力,将逐步开放给用户。

机器之心
算法论文7

LLM加RL遭质疑:故意用错奖励,数学基准也显著提升,AI圈炸了

华盛顿大学等机构论文引爆AI界,其发现用虚假奖励训练Qwen2.5-Math-7B模型,也能提高MATH - 500成绩。虚假奖励对Qwen模型有效,但在其他模型上有限,凸显RLVR有效性与模型能力有关。

机器之心
产品应用8

三年连下三癌,阿里AI跑通了多癌筛查

4月21日,阿里达摩院和广东省人民医院等机构研究登《肿瘤学年鉴》。其研发的AI模型DAMO COCA从平扫CT揪出5例漏诊肠癌,准确率超医生。此前,该团队已推出胰腺癌、胃癌筛查模型,跑通‘平扫CT+AI’多癌筛查路线。

AI科技评论
开源动态8

一句话复刻谷歌!我用智谱新开源的GLM-4.5,把Agent开发打回了简单模式。

智谱AI深夜发布开源的新一代旗舰模型GLM - 4.5,目标成为最强Agent基座。它能一句话复刻搜索引擎,多能力原生融合,在多项测试中表现出色,推理快、价格,还通过多关压力测试,且开源成本

探索AGI
开源动态8

不用人类手写训练框架了!AI自己写代码,训出1B端侧「小钢炮」

5月25日,面壁开源端侧文本基座大模型MiniCPM5 - 1B,主打成本部署等。它由AI编写的ForgeTrain框架参与预训练,效果与英伟达Megatron对齐且速度快10%。该模型在榜单表现优,应用边界广,部署门槛

机器之心
算法论文8

英伟达笑到最后!训练2000步,1.5B逆袭7B巨兽,Scaling真来了

英伟达团队提出ProRL训练法,将强化学习扩展到超2000步。用此方法训练的15亿参数模型媲美70亿参数的Deepseek - R1 - 7B,在多任务中表现出色,解决了崩溃和训练不稳定问题。

新智元
算法论文8

NVIDIA港大MIT联合推出Fast-dLLM v2:端到端吞吐量提升2.5倍

自回归大语言模型推理效率受限,Fast - dLLM v2 由 NVIDIA、港大、MIT 联合推出。它将预训练 AR 模型适配为能并行解码的 Block - dLLM,用约 1B tokens 微调,端到端吞吐量最高提升 2.5 倍,精度相当。

机器之心
开源动态8

蚂蚁百灵新一代Ling-3.0开源,智效比13.2,124B释放1T能力

蚂蚁百灵新一代模型Ling-3.0开源,有flash和tiny两版本。Ling-3.0-flash参数量124B,智效比13.2,输出快成本;Ling-3.0-tiny参数量7.9B,激活少且适用多场景,二者都极致挖掘模型效率。

AIGC开放社区
算法论文8

告别微调!斯坦福提出Agentic上下文工程

当前微调大语言模型成本高、不灵活,‘上下文适应’方法有短板。斯坦福大学等提出ACE框架,将上下文变为动态‘战术手册’,解决现有问题。论文通过实验验证其在性能、成本和效率上优势,为大模型发展指明新方向。

深度学习自然语言处理