「元数据性能」共找到 4634 篇相关文章
8B模型可以超过GPT-4o!并行KV Cache压缩支持的128K长度外推方法ParallelComp
大模型长文本推理存在瓶颈,作者提出 ParallelComp 方案。它有并行 Attention 分块、KV 缓存智能淘汰与注意力偏差校准三大创新,能让 8B 模型性能达 GPT - 4o 的 91.17%,特定任务超 GPT - 4o。
告别微调时代:拖拽式LLMs实现12000倍加速适配,输入描述,秒级定制LLM,效果、速度全面超越
传统高效微调技术成大规模部署瓶颈,论文提出Drag-and-Drop LLMs (DnD),仅需输入目标任务未标注提示,即可秒级生成适配的LoRA权重,实现LLM秒级免训练适配,效率、性能和泛化性上均有突破。
超越DeepSeek-R1,英伟达开源新王登顶!14万H100小时训练细节全曝光
英伟达Llama - Nemotron系列模型超越DeepSeek - R1且全部开源。论文揭秘其训练关键,如用合成数据监督微调与强化学习等。还介绍构建阶段、架构设计等,评估显示该系列模型在多任务表现出色。
Claude Opus 4.7深夜上线,评分碾压
周四晚间,Anthropic 宣布 Claude Opus 4.7 全面上市。它在高级软件工程、视觉效果上表现出色,多项基准测试优于 Opus 4.6。还具备新特性,如自动模式等,安全性能与 Opus 4.6 相似。此外,Anthropic 还有相关更新。
最新豆包、deepseek、元宝、夸克、千问、百度、文心、Kimi、微信搜一搜、抖音、小红书等AI搜索生成内容引用来自哪些地方?【干货】
作者白杨SEO指出,生成式人工智能发展快,AI搜索优化GEO受关注。介绍了豆包、DeepSeek等多个AI搜索生成内容引用来源,如豆包引用抖音、头条等,DeepSeek用开源数据等,还提及各平台优化要点。
英伟达叫板DeepSeek?怒投260亿美元,要打造最强开源模型
英伟达已成为人工智能时代基础设施的一部分,2023年11月推出首个Nemotron模型进入通用大模型领域。未来五年将投260亿美元构建开源模型,还发布了性能最强的开源模型Nemotron 3 Super。
最鲁棒的MLLM!港科大开源「退化感知推理新范式」 | AAAI'26
多模态大语言模型(MLLMs)在真实世界视觉退化下性能崩溃,制约产业落地。港科大等团队开源的Robust - R1被AAAI 2026接收为Oral,提出显式结构化推理新范式,实现质量与鲁棒性双重突破。
医生版 ChatGPT 3 年估值 60 亿美金,被低估的 AI 硬件新玩法:相框
OpenEvidence被称为医学领域的Google和医生版ChatGPT,成立3年估值达60亿美金。它用高质量数据训练小而专模型,有“无幻觉”机制,直接面向医生推广,产品进化为临床决策助手,收入来自制药广告。
一个模型超了DeepSeek R1、V3,参数671B,成本不到350万美元
Deep Cogito 是旧金山 AI 初创公司,开源四款混合推理模型。最大 671B MoE 模型性能超 DeepSeek v3 等,推理链比 DeepSeek R1 短 60%,训练成本不到 350 万美元。核心方法是迭代蒸馏与增强。
一句话让数据库裸奔?Supabase CEO:MCP 天生不该碰生产库
安全研究团队警告,使用Cursor搭配MCP可能致SQL数据库泄露,攻击者靠一条信息就能实现。MCP被广泛接入,其配置问题成AI应用核心安全挑战。如Supabase MCP,攻击者用留言让Cursor代理复制私密表数据。