「4B 参数」共找到 2491 篇相关文章
Sonnet 5 翻车!同性能价差最高 56倍,海外巨头为何复刻不出 DeepSeek?
Anthropic发布Claude Sonnet 5,官方称补足了Agent能力,价格优惠,但开发者反应不佳。Sonnet 5因tokenizer换代,实际使用成本更高,且比同类模型贵。与之相比,DeepSeek V4 Pro便宜很多,其靠技术实现低价,海外厂商难以复刻。
中学生就能看懂:从零开始理解LLM内部原理【九】| 层归一化:神经网络的稳定器
本文是系列文章第九篇,介绍了神经网络中的层归一化。先回顾标准差、标准分概念,指出其可使差异可控稳定。接着说明层归一化将原思想用在神经网络,还加入可学习参数,最后总结其作用与应用位置。
OpenAI发布GPT-5!这是一篇很主观的解读...
OpenAI发布GPT - 5,一口气推出三个版本API。发布会图表出错被吐槽,其自适应思考能力似抄Claude作业。发布会重押编程能力,因Anthropic靠Claude在API市场抢了不少写代码用户,实测中GPT - 5与Claude 4.1表现接近。
大模型热度退潮,真正的技术创新者开始被「看见」
过去两年中国大模型投资多是商业模式驱动,而技术投资注重创新。DeepSeek 出圈后,独立创新成主流。今年国内大模型吸金热度下降,但智谱 AI、面壁智能仍获融资。面壁智能发布 MiniCPM 4.0,在多方面优化,展现端侧优势。
AMS| 西工大史子颉,高传强,王旭,林海涛,张伟伟:数据驱动的涡激振动标度律发现
涡激振动最大振幅是评估结构安全的关键指标,现有理论模型有局限,常用数据驱动方法也面临挑战。本文提出两次应用符号回归的“白箱”标度参数VIV建模方法,验证了其鲁棒性与泛化能力,还给出物理层面解释。
中国黑马狂赚3亿美金!国内AI应用断层第一,估值20亿美金
演语科技完成近3亿美元B+轮融资,投后估值超20亿美元。其ARR超3亿,构建起业务闭环。旗下LibTV、LiblibAI和星流表现出色,创始人陈冕布局生态,演语已成全球第一梯队玩家。
Teleport 报告:AI 安全事件频出,背后往往是过度授权
Teleport报告指出,为AI系统授予过度访问权限的企业,安全事件发生率是权限管控合规企业的4.5倍。身份管理体系建设跟不上AI落地速度,精细化权限授予是关键,还给出搭建统一身份层等建议。
最懂英伟达的CoreWeave,为啥突然花钱买了个强化学习作坊?
算力巨头CoreWeave市值达483.9亿美元,收购专攻强化学习训练AI智能体的OpenPipe。CoreWeave想打造全能平台,此前已收购W&B,此次收购标志其涉足智能体核心训练环节。OpenPipe的ART框架有独特优势。
AI Agent平台Sedai获2000万美元融资,主打云优化
AI Agent平台Sedai获2000万美元B轮融资,由AVP领投。它聚焦云优化,用智能体取代人工运维,节省成本。产品应用广泛,核心能力突出,2024年收入增长7倍,计划扩平台、引新功能、扩市场团队。
全球顶尖大模型一夜惨遭血洗!最难测试人类拿满分,AI第一名得0.2%分
全球最难AGI测试ARC - AGI - 3上线,人类满分通关,最强模型Opus 4.6仅得0.2%。测试从静态题变为互动游戏,评分看效率。前沿大模型得分低,非LLM方案表现更好,AI缺乏元认知能力。