「以模型为中心」共找到 8600 篇相关文章
用「传心术」替代「对话」,清华大学联合无问芯穹、港中文等机构提出Cache-to-Cache模型通信新范式
随着大语言模型发展,多智能体系统中现有T2T交流方式有信息丢失、语义模糊、延迟大问题。清华等团队提出C2C信息传递方式,以KV - Cache为媒介,提升了正确率和速度,还介绍了实现路径、优势及应用前景。
Anthropic神话模型发布,但不让你用
Anthropic发布神话模型Claude Mythos Preview却不开放使用,发起玻璃翼计划联合科技巨头用该模型修复全球软件漏洞。此模型能自主发现众多零日漏洞,合作伙伴应用后强调跨行业协作应对网络安全挑战。
阿里Qwen3.5小模型发布:0.8B参数就能处理视频,边缘AI时代真的来了
阿里通义千问发布Qwen3.5系列四款小模型,采用Gated DeltaNet混合注意力机制。有原生多模态设计,解决“内存墙”问题。在多基准测试中表现出色,开发者反响好,但也存在幻觉级联、调试局限等问题。
ICLR 2026 Oral|大模型总爱「想太多」? DECS从源头消除冗余思考,实现推理token减半且性能不降反升
以DeepSeek - R1等为代表的大型推理模型存在过度思考问题,造成大量冗余计算。复旦大学等团队在ICLR 2026 Oral论文中揭示‘长度惩罚’局限性,提出DECS框架,在多基准测试中实现推理长度减半且性能提升。
一个提示攻破所有模型,OpenAI谷歌无一幸免!
HiddenLayer研究发现一种「策略傀儡」提示,将危险指令伪装成配置片段,配上角色扮演,能让ChatGPT等主流大模型开启「无限制模式」。此策略利用训练弱点,难修复且可扩展,厂商需智能监控。
哈佛《Science》研究:大模型已碾压人类医生!
哈佛医学院等团队让OpenAI o1系列大模型与数百位医生在多项测试中较量,大模型在各项诊断和管理推理任务上全面超越人类专家,不过当下模型处理非文本信号有局限。
Mistral 3发布,14B多模态小模型表现优异
Mistral AI第三代模型发布,含三个小型密集模型和稀疏混合专家模型Mistral Large 3,全用Apache 2.0许可。有多项技术亮点,Ollama等支持部署微调,还给出实用配置建议。
Code2Video:全新AI教学视频生成框架,助力高质量教学
生成式模型在生成专业教育视频时受限,新加坡国立大学Show Lab提出Code2Video框架,以代码为中心,由三个协作智能体组成,能通过Python代码自动生成高质量教育视频,代码驱动生成优势明显。
Rex-Omni:用 3B 模型颠覆目标检测
长期目标检测依赖传统坐标回归模型,MLLMs方法存在不足。IDEA研究院提出30亿参数的Rex - Omni多模态大模型,在零样本测试中表现超现有回归模型,还具备丰富语言理解能力,有独特设计和训练流程。
从“暴力烧Token”到“系统工程”:OpenAI与华为的两条 AI 编程路径
文章对比OpenAI与华为的AI编程路径,指出模型中心派靠推高上下文窗口但有成本高、延迟大等问题;工具驱动派如Cursor和华为云码道重构IDE工具。码道将任务解耦,通过多技术实现性价比,还介绍了底层基石及其实测表现。