「Agent模型」共找到 9472 篇相关文章
轻量高效,即插即用:Video-RAG为长视频理解带来新范式
现有视觉语言模型处理长视频面临诸多难题,厦门大学等联合提出轻量高效、无需微调的 Video-RAG 框架,采用多模态辅助文本检索增强生成,解决长视频理解问题,适用于多场景。
100美元、8000行代码手搓ChatGPT,Karpathy最新开源项目爆火,一夜近5k star
AI大神Andrej Karpathy发布开源项目nanochat,可教你100美元自建ChatGPT,覆盖LLM训练和推理。项目有8000行代码,不到12小时获超4500 star,功能丰富,但他认为它不适合个性化应用。
LLM协作告别文本形式:直接“脑对脑”,Cache-to-Cache实现语义瞬时传输
现有多LLM系统依赖文本通信,效率低且易失真。论文提出Cache - to - Cache(C2C)范式,让LLMs通过KV - Cache“脑对脑”交流,实现高效精准语义传输,在多类任务中提升性能与效率。
国产手机正从底层重构安卓!vivo版AI OS亮相了
在vivo开发者大会上,OriginOS 6正式亮相,AI功能全面更新,还首次上线Live Photo的AI消除。它用自研技术重构安卓底层核心,首发蓝河流畅引擎,从计算、显示、存储三大模块优化。
Jina Reranker v3: 全新“列式”重排器,0.6B参数刷新文档检索SOTA
Jina AI推出第三代重排器Jina Reranker v3,在多语言检索基准上刷新SOTA。它参数仅6亿,有“last but not late”交互机制,能一次性处理查询和文档。还提供动态量化格式,方便不同硬件部署。
LeCun力荐的JEPA杀入LLM,用CV的思路训练LLM,性能鲁棒性双丰收
LeCun团队提出LLM - JEPA,将JEPA自监督学习架构从视觉扩展到LLM。它能提升性能和鲁棒性,在多模型和数据集验证有效,但有训练开销大、泛化性不足等局限。
阿里云容器服务覆盖AI全流程,团队透露:OpenAI训练GPT时就用了我们的开源能力
拿下中国AI云市场第一后,阿里云技术产品负责人开展AI Infra分享会。其全栈云计算搭好技术架子,10万GPU集群高效互联,容器服务贯穿AI全流程,还透露OpenAI训练GPT时用了其开源能力。
Claude官方即将推出Chrome浏览器插件,可能....其它所有的AI浏览器插件都会死。
Claude官方即将推出Chrome浏览器插件,现正进行小范围测试。它功能强大,能在侧边栏操作页面,还能处理日程、邮件等工作。相比多数插件,它安全性高,或让仅能总结摘要的插件被淘汰。
从需求分析到代码生成,LLM都能干点啥?一文读懂291个软工Benchmark!
大语言模型重塑软件工程各环节,但缺乏评估其在该领域表现的系统工具。浙江大学等机构团队首次对291个软件工程Benchmark系统综述,分析现状、痛点并给出改进方向。
视觉Token注入CLIP语义,走向多模态理解与生成新范式
腾讯ARC Lab等机构提出全新视觉分词器TokLIP,将低级视觉Token与高级CLIP语义结合,支持端到端自回归训练,可接入LLM框架,降低计算与数据门槛,在多模态任务中表现优异,代码已开源。