「大模型成本」共找到 9737 篇相关文章
喂给AI的Skill正让它变笨!清华团队发现大模型经验复用的黄金法则
清华大学与EvoMap团队研究发现,给大模型提供详尽纠错Skill会使基准测试通过率下跌,而精简控制指令可提升性能。他们提出将程序化Skill转化为策略基因,经实验证实其更适合驱动智能体测试时演化。
大模型收入暴涨1076%,港股AGI第一股首份年报:一年狂揽12亿,属实把商业化玩明白了
港股AGI第一股云知声披露首份年报,全年营收12亿,大模型业务收入暴涨1076%成核心增长引擎。其靠“强基模、深应用”战略实现业绩增长,还计划拓展MaaS模式,探索多元“第二曲线”。
国内首套:港中文团队发布7模态人体动作数据集,揭开大模型理解能力短板
港中文邢国良教授团队博士生蒋思阳完成 CUHK-X 多模态人体动作数据集,成果被 ACM MobiSys 2026 接收。用其测试主流大模型,发现理解人类动作平均正确率仅四成。该数据集数据收集方法反常规,还开展了基准测试。
全新GPU高速互联设计,为大模型训练降本增效!北大/阶跃/曦智提出新一代高带宽域架构
随着大模型参数规模扩大,分布式训练成关键路径,高带宽域设计对提升训练效率至关重要。现有HBD架构在可扩展性、成本和容错能力等方面有局限,北大、阶跃、曦智团队提出InfiniteHBD架构解决问题。
Qwen&清华团队颠覆常识:大模型强化学习仅用20%关键token,比用全部token训练还好
Qwen与清华LeapLab团队研究发现,大模型强化学习训练推理能力时,仅20%高熵token就能撑起效果,甚至超全部token训练。团队用此在Qwen3-32B创造新SOTA记录,还探讨了强化学习的相关特性。
大模型API的大众点评来了:7×24小时实测,毫秒级延迟智能路由,选API必备
清程极智推出的AI Ping像大模型API领域的大众点评,用7×24小时实测数据为开发者提供参考,解决信息差和重复劳动问题。它有持续评测榜单、智能路由匹配等功能,还统一了API度量衡,推动选型从经验走向数据驱动。
我用大模型砌“屎山雕花”:5天肝出几万行代码!产品经理的AI编程翻车记
作者作为非技术背景的产品经理,分享用大模型编程经历。先借 MCP 搭建应用,后 5 天产出大量代码却问题多。经三次重构领悟协作方法,还总结沟通技巧,指出 AI 编程改变产品经理工作,未来需融合多角色能力。
消费级显卡跑大模型训练门槛再降:Qwen3-1.7B强化学习只需5GB显存
消费级显卡跑大模型训练门槛再降,Unsloth AI的FP8精度强化学习方案让Qwen3 - 1.7B的GRPO训练只需5GB显存且性能无损。该方案与TorchAO合作,有推理优势,还在内存优化等方面表现出色。
监督学习未死,一题训练五小时起飞!华人学者新方法20倍训练效率释放大模型推理能力
大模型推理能力研究中,RL训练资源成本高、不稳定,传统SFT低数据量易过拟合。加拿大滑铁卢大学华人团队提出One - Shot CFT方法,用一题多解多点评训练,仅需约5个GPU小时,效果好、稳定性强。
港股AGI第一股“云知声”首战告捷:大模型贡献1亿收入,单客价直线提升116.2%,AI保险业务暴涨1386.8%
云知声发布《2025中期业绩报告》,亮点颇多。总收入4.05亿元,同比增20.2%,山海大模型收入近1亿,增幅457%。业务布局呼应国务院‘人工智能+’行动,技术优势明显,展现了AI产业化落地的成功模式。