「DeepSeek - V3」共找到 984 篇相关文章
MiniCPM 4.0极速狂飙,端侧模型的比赛,结束了!
面壁智能联合清华发布MiniCPM 4.0,极限场景220倍加速。它是首个原生稀疏模型,有InfLLM v2、CPM.cu等创新,基准测试碾压对手,适配全平台,还有科研、工具调用等功能,标志端侧长文本时代到来。
阿里的 AI IDE 登场了,这事绝对有戏
阿里云正式发布通义灵码的AI原生IDE:Lingma IDE,免费开放,核心功能和Cursor对齐且速度更快。其整合Qwen、DeepSeek系列模型,有感知引擎等亮点,还有企业版适合国内公司。AI编程竞争激烈,阿里有机会做成。
Multi-Agent 的灵活编排之路
文章从Copilot 3.0架构规划模块出发,结合DeepSeek R1强化学习训练实践,探讨多智能体架构下大模型编排智能体解决问题。分析Copilot 2.0局限并介绍3.0升级,指出难点,展示效果对比及解决方案。
20刀月费秒变API!Hermes一行命令就能用上Claude、ChatGPT订阅
两大开源Agent框架有硬核更新。Hermes Agent v0.14用一行命令把模型订阅变API,零成本驱动开发工具,还接入Grok。OpenClaw 5.18修复问题,适配Grok。20美元月费可喂饱工具链,打破生态闭环。
ICLR 2026 Oral|大模型总爱「想太多」? DECS从源头消除冗余思考,实现推理token减半且性能不降反升
以DeepSeek - R1等为代表的大型推理模型存在过度思考问题,造成大量冗余计算。复旦大学等团队在ICLR 2026 Oral论文中揭示‘长度惩罚’局限性,提出DECS框架,在多基准测试中实现推理长度减半且性能提升。
开源安全工具 Trivy 遭供应链攻击,引发行业紧急响应
开源漏洞扫描工具 Trivy 遭供应链攻击,恶意版本 v0.69.4 含外传敏感数据代码,通过正常渠道传播。攻击者利用攻破的凭证操控发布流程,影响或扩大,维护团队已采取措施,引发行业对开源工具信任边界的讨论。
Claude Code 推出 Monitor 功能,帮你随时盯梢
Claude Code 在 v2.1.98 版本推出 Monitor 功能,可让 Agent 后台挂监控脚本,解决轮询痛点。它能覆盖日志监控等多场景,与 /loop、/schedule 功能有别,使用有注意事项,反映 Anthropic 让其成工程系统的方向。
黄仁勋中国现场直击!假如有一个「数字黄仁勋」,我希望我们一起变聪明
英伟达CEO黄仁勋再访北京,接受新智元等媒体采访。他盛赞华为优秀,评价DeepSeek等模型出色,还谈及AGI、数字分身、出口管制等话题。此外,H20芯片解禁重售释放政策信号,有望实现中美科技企业合作共赢。
杨植麟被梁文锋叫醒了!Kimi新模型发布即开源,1T参数全线SOTA
172天后,Kimi推出全新Kimi K2基础大模型回应DeepSeek冲击。它为MoE架构,1T参数,激活参数32B,在多任务上领先,发布即开源,还分享技术细节,实测有亮点也待优化,展现回归之势。
ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键
ICML 2025新研究揭示,在使用RoPE的现代Transformer模型里,注意力机制Q和K表示有集中极大值,V表示无此模式。研究通过实验明确极大值与上下文知识理解的联系,对模型设计、优化和量化有重要启示。