「模型协同」共找到 7897 篇相关文章
谷歌DeepMind:AGI不必是巨型模型,拼凑型AI群或率先涌现,管理大规模Agent迫在眉睫
DeepMind最新研究提出,AGI未必以单一巨型模型形式出现,可能由多个次级AGI智能体协作拼凑涌现。为此,团队提出分布式AGI安全框架,包含四层深度防御模型应对新安全挑战。
Karpathy盛赞DeepSeek-OCR“淘汰”tokenizer!实测如何用Claude Code 让新模型跑在N卡上
DeepSeek发布新模型DeepSeek - OCR,在实用场景达SOTA且token消耗最少。Karpathy赞其或淘汰tokenizer,Pleiasfr联合创始人称是里程碑。开发者Simon用Claude Code让模型在NVIDIA Spark上跑通。
Anthropic最强网络攻防大模型Mythos,美国国安局早就一直在用了
美国政府准备向多个联邦机构开放Anthropic新模型Mythos的‘修改版’,虽国防部将Anthropic拉黑,但国安局一直在用Mythos。白宫先明确模型接入的权限、用途等边界,再推进接入,各方对其态度有分歧。
1.58bit不输FP16!微软推出全新模型蒸馏框架,作者全是华人
微软推出蒸馏框架BitNet Distillation,实现几乎无性能损失的模型量化。它含三阶段,经实验在多下游任务表现近全精度模型,降内存开销、提推理速度,作者全是微软研究院华人。
英伟达再出手!新型混合架构模型问世,两大创新实现53.6倍吞吐提速
英伟达研究者提出新混合架构语言模型 Jet - Nemotron,在达 SOTA 全注意力模型精度时效率卓越,2B 版性能超 Qwen3 等,H100 GPU 上生成吞吐量最高加速 53.6 倍,基于 PostNAS 和 JetBlock 两大创新。
让大模型“跑”在手机里:vivo蓝心端侧部署创新揭秘,性能功耗双优!
在AICon2025上海站,vivo AI研究院工程师章苏迟分享蓝心大模型端侧部署方案。介绍端侧大模型优势及应用场景,阐述内存、性能、功耗等指标优化方法,还提及多业务场景应对策略与安全合规措施。
谷歌首个原生多模态向量模型发布:Agent 可以用文字搜图片、用图片搜视频了...
谷歌推出首个原生多模态嵌入模型Gemini Embedding 2,通过Gemini API和Vertex AI公开预览。它将文本、图像等映射到统一向量空间,支持多模态交错输入,性能超越现有领先模型,开发者可快速接入。
究竟会花落谁家?DeepSeek最新大模型瞄准了下一代国产AI芯片
近期,DeepSeek发布V3.1新模型,采用全新混合推理架构,在多任务表现上有提升。它采用UE8M0 FP8,或为国产推理芯片优化机制。国内多家厂商新一代AI芯片支持FP8,未来国产大模型或针对其专门优化。
刚被马斯克收购,Cursor掏出新模型:10万卡加持,和Opus、GPT一样大
本周二,刚被SpaceX收购的Cursor在首届旗舰大会宣布新的1.5万亿+参数模型,在超10万块GPU预训练。Cursor CEO称其规模与Opus、GPT相当,还谈了对其他AI实验室看法,新模型将几周内发布。
AAAI 2026 Oral | 大模型「爱你在心口难开」?深度隐藏认知让推理更可靠
合肥工业大学团队提出大模型存在‘隐藏的真伪认知’,论文让模型用此给推理‘打分’,过滤错误推理链。通过多层注意力头探测、构建预测器和新推理扩展策略,提升了推理链稳定性,实验效果优异。