零样本扩展」共找到 913 篇相关文章

开源动态8

第二代InfLLM开源,同尺寸快三倍!参数,可训练稀疏注意力

新智元报道,清华、OpenBMB和哈工大提出额外参数、训练高效的原生稀疏注意力框架InfLLM-V2,仅用5B长文本词元就能完成训练,相比稠密注意力机制有显著加速,性能接近传统稠密模型。

新智元
算法论文8

仅需152个样本,性能提升48%:Memory-R1如何重塑Agent记忆能力?

这篇文章解读论文Memory - R1,其由多所高校研究团队完成,旨在解决LLM在长对话和多轮任务中的‘记忆难题’。通过强化学习让LLM学会管理记忆,用152个问答对训练,大幅超越现有基线模型。

深度学习自然语言处理
新闻资讯8

中国科协重磅回击,NeurIPS含金量一夜归!AI顶会已死?

NeurIPS以「合规」为由出台歧视性政策,引发强烈不满。其官方回应遭群嘲,中国科协出手将其2026年在中国学术评价体系中「含金量」归,顶尖学者集体退审,顶会审稿制度也在坍塌。

新智元
产品应用7

一手实测!不用研究小龙虾了:腾讯搬出QClaw,直连微信,门槛

腾讯基于OpenClaw开源生态推出QClaw,主打简单、门槛部署,可直连主流大语言模型,集成微信能远程操控电脑。还推出SkillHub技能社区,腾讯电脑管家有安全防护功能,但权限问题待解决。

机器之心
开源动态7

DeepSeek|从构建轻量级vLLM:Nano-vLLM,吞吐量逼近原版,代码仅需1200行

开源的vLLM能提升LLM推理速度和资源利用率。近日,DeepSeek AI俞星凯从构建轻量级Nano - vLLM,代码仅1200行。它有离线推理等功能,基准测试显示吞吐量逼近原版。

AINLPer
推荐文章7

17.6K Star跨平台逆向工程神器!免费替代IDA Pro,支持插件扩展

在二进制文件分析或软件逆向工程中,专业工具如IDA Pro界面复杂、学习成本高。文章推荐开源跨平台逆向工程平台Cutter,它基于rizin核心引擎,功能完善,可降低使用门槛。

开源星探
算法论文8

ParScale:一种全新的大模型Scaling Law

文章提出并行扩展(ParScale)路线,在不增模型参数下,通过引入并行流提升性能。新扩展定律打破传统范式,两阶段后训练策略降成本,还适用于边缘设备,研究仍在进行。

通义千问Qwen
产品应用7

实战指南:从构建 MCP 架构下的 Agentic RAG 系统,无第三方MCP Server

五一期间作者用MCP架构从实现Agentic RAG系统,分享MCP与Agentic RAG融合思考、架构设计,介绍MCP服务端和客户端实现,还做了端到端效果演示,指出架构优势及待优化处。

AI大模型应用实践
新闻资讯3

烧掉数万亿 Token、数百 Agent 连跑一周:Cursor“从写浏览器”,结果是拼装人类代码?

Cursor CEO分享用GPT - 5.2让系统运行一周从构建浏览器的实验,产出大量代码。但实验引发质疑,项目编译难通过,代码还依赖成熟库,像是拼装人类代码,且实验成本高。

InfoQ
产品应用8

Uber Hive 联邦架构:1.6 万数据集、10PB 数据去中心化,支撑大规模分析停机

Uber重新设计Hive数据仓库,将超16000个数据集、超10PB数据去中心化部署,解决可扩展性等挑战。采用基于指针方案迁移,系统含四大组件降低运营风险,还减少存储开销,提升生态弹性。

InfoQ