模型参数量」共找到 8195 篇相关文章

推荐文章8

AI 基础知识从 0.5 到 0.6—— Transformer 架构为何能统治AI领域?

文章围绕Transformer架构展开,先介绍其诞生背景,对比CNN、RNN等模型,阐述其在多领域的核心地位。接着剖析工作流程、实现原理,包括QKV机制、多头注意力等。最后列举T5、GPT等常见架构模型,并提及通义千问3与MCP协议。

阿里云开发者
新闻资讯8

OpenAI发布新模型硬刚Anthropic!Claude Code刚火,就被GPT-5-Codex拍在沙滩上?

9月15日,OpenAI推出新模型GPT - 5 - Codex,是微调的GPT - 5变体,用于AI辅助编程。它增强了代码审查功能,能动态调整思考时间,在多项基准测试中表现优于GPT - 5,发布后引发网络热议,AI编码工具市场竞争激烈。

AI前线
开源动态8

基础模型又一关键拼图,腾讯混元发布训练新范式「无相」:引入功能性记忆,打破静态权重枷锁

腾讯混元团队发布HY - WU范式,打破静态权重束缚,引入功能性记忆,实时生成个性化参数。应用于图形编辑基模效果好,在图像编辑任务表现优秀,还对未来AI架构提出多方面展望。

量子位
新闻资讯7

抨击AI炒作、曝企业需求为先,Anthropic 联创:模型提 0.01 性能就血赚,算力烧钱但值!

Anthropic由7位前OpenAI核心成员创立,联合创始人兼总裁Daniela Amodei接受采访,谈到成本控制、AI安全及上市可能。她认为AI安全是核心优势,公司谨慎对待支出和算法效率,虽算力投入大,但硬件回报高。

AI前线
开源动态8

模型能否为不同硬件平台生成高性能内核?南大、浙大提出跨平台内核生成评测框架MultiKernelBench

深度学习计算依赖底层内核,当前多由开发者手工编写。南大、浙大推出开源评测框架MultiKernelBench,打破现有评测基准局限,构建模块化评测体系,多模型实测,还指出LLM短板并明确未来方向。

机器之心
产品应用8

拿下3D生成行业新标杆!昆仑万维Matrix-3D新模型鲨疯了,一张图建模游戏场景

昆仑万维推出3D世界生成框架Matrix - 3D,能从单图像生成高质、轨迹一致的全景视频并还原可漫游3D空间。它优势明显,还突破多项技术难题,背后是昆仑万维对空间智能的战略布局。

量子位
新闻资讯7

GitHub 2.5万星!日本开发者打造的Hono火了:定义后React时代微框架的轻未来

本周,Web 框架 Hono 在 X 官宣,GitHub 获 25000 星标。它由日本开发者 Yusuke Wada 于 2021 年创建,基于 Web 标准,可在多运行时运行,或指明后 React 时代 Web 框架方向。

InfoQ
产品应用7

Cursor 2.0 来了!自研模型 Composer1,更禅的界面,多代理并行,Browser调试更强大

Cursor 2.0 发布,有诸多升级。它有自研编码模型 Composer1,速度快且适合 Agent 模式;界面更清爽禅意;支持多代理并行,能提升编码效率;浏览器可嵌入编辑器,沙盒终端在 macOS 正式发布等。

AI进修生
7

代码里插广告,腾讯 Codebuddy 们 “背锅”?DeepSeek “极你太美”事件,其他模型也逃不掉?

网友发现腾讯 Codebuddy 改写代码时插入广告,字节 Trae 国内版生成结果有‘极’字 bug,根源指向 DeepSeek V3.1。除 DeepSeek 外,Gemini、Grok、Qwen3 等模型也有类似问题。大家对原因有多种猜测。

InfoQ
算法论文7

基于大模型的领域场景开发:从单智能体到多智能体的React框架设计与实现

作者团队经历从提示词工程到流程编排模式各阶段,现设计架构升级,选用层级指挥模式的React框架,实现单智能体对工具调用的反思规划,后续还将迭代实现多智能体协作,同时提及技术选型、系统架构等内容。

阿里云开发者