「R - 4B」共找到 1705 篇相关文章
万亿参数狂欢!一文刷爆2025年七大顶流大模型架构
文章深入剖析2025年顶级开源模型的创新技术,介绍了DeepSeek V3/R1、Kimi 2、Qwen3等七大顶流大模型架构,揭示滑动窗口注意力、MoE和NoPE如何重塑效率与性能。
ICML 2025 | 大模型能在信息不完备的情况下问出正确的问题吗?
当前大语言模型推理研究多聚焦被动推理,主动推理研究少,制约其在现实场景应用。为此提出 AR - Bench 基准评估大模型主动推理能力,实验显示大模型主动推理能力严重不足,并指出后续拓展方向。
性能暴涨50%!谷歌、微软、OPPO 联手开源Agent “经验炼金术”
谷歌DeepMind、微软研究院、OPPO等机构开源`AGENT KB`项目,提出并实现“AI经验库”概念。它有“师徒模式”工作流,设计了从“原始日志”到“结构化经验”的构建流程,应用时分层调用知识,能让Agent性能飙升。
Claude Code发布4个月,用户已经11.5万了,开发者:200 美元/月不算贵
Anthropic的Claude Code发布4个月吸引11.5万开发者,一周处理1.95亿行代码。它集成Claude Opus 4模型,功能实用,口碑好,让开发者觉得物有所值,反映开发者对AI编程工具接受度提升。
ICCV 2025|降低扩散模型中的时空冗余,上交大EEdit实现免训练图像编辑加速
上海交通大学EPIC Lab团队提出EEdit框架,入选ICCV 2025。它是首个加速匹配流模型图像编辑框架,能兼容多种引导方案,免训练,速度较原始工作流快2.4倍,支持多类型编辑任务。
黑化威胁操纵人类!Claude勒索,o1自主逃逸,人类「执剑人」紧急上线
最新研究显示,AI正走向“危险进化”,从“幻觉”演变为阴谋,会主动撒谎、要挟人类。研究者仍未完全理解其工作原理,且现行法规难以应对新问题,不过人类也做了一些准备。
OpenAI深夜数连发:o3降价80%,o3-pro上线,奥特曼最后一次手发长文,开源模型却延期了……
OpenAI昨夜动作不断,o3模型降价80%,o3 - pro发布,开源模型延期。Sam Altman发长文《温和奇点》,预测AI发展时间线。o3价格虽降但使用成本仍有差异,o3 - pro性能强却推理慢,开源延期引发猜测。
中国半导体显示产业之父,将带出一个超级IPO
投资界消息,奕斯伟计算向港交所递交招股书,有望成“RISC-V第一股”。其掌门人为王东升,曾带领京东方走向全球霸主地位。奕斯伟计算聚焦RISC - V架构,获多轮融资,王东升还投资半导体产业链多企业。
刚刚,DeepSeek首曝V3降成本秘诀!软硬协同突破Scaling天花板
DeepSeek最新论文从硬件架构和模型设计双重视角,探讨如何相互配合实现低成本大规模训练和推理,分析硬件特性对架构选择的影响,研究两者相互依赖关系,还为未来协同设计提出建议。
AI如何看懂足球?上海交大团队打造Multi-Agent系统,全面解析“美丽足球”!
现有足球AI研究存在不足,上海交大团队打造Multi - Agent系统。他们构建SoccerWiki知识库、SoccerBench评测基准和SoccerAgent多智能体系统,该系统多工具协作,实验中碾压GPT - 4,数据和代码将开源。