「新模型Spud」共找到 9428 篇相关文章
大神周末开源省token野路子,claude fable5账单砍掉6成
外网大神周末开源插件,将模型上下文等渲染成图片,可让账单降低59% - 70%。原理是图片token只与像素尺寸有关。此前因模型识图能力差难落地,fable5证明其极限省钱且效果保留。
终结数据荒!智源开源首个Deep Research数据合成框架InfoSeek
在大模型深度研究中,高质量数据是短板。近日,智源研究院发布首个面向深度研究的开源数据集InfoSeek,提出「扩散 - 回溯」数据合成方法,用3B模型在基准测试中接近商业模型表现,且数据集可扩容。
伯克利神作背刺OpenAI:持续学习才是真神!
伯克利等机构发布FST框架,通过快慢分层解决大模型持续学习死局。过去两年头部实验室都在提升模型推理能力,却忽视持续学习。FST让模型像大脑一样快慢分层,提升数据效率、减少遗忘,使持续学习可工程化。
内容娱乐新风向:这群创业者靠多模态 AI 玩出了新花样
12月23日,「MASHANG DEMO TO DAILY」第二期活动在杭州开启,展示多模态AI探索成果。6位创业者分享精华内容,涉及游戏开发、虚拟社区、视频创作等领域,探讨多模态AI产品价值与发展方向。
苹果憋一年终超同参数 Qwen 2.5?三行代码即可接入 Apple Intelligence,自曝如何做推理
今年 WWDC 大会上,苹果推出专为增强 Apple Intelligence 功能的语言基座模型,含约 3B 参数紧凑型与基于服务器的混合专家模型。经优化可在苹果芯片高效运行,改进工具使用与推理能力,评测显示设备端模型表现优。
基于 Qwen3-VL-Embedding-8B 实现文搜图语义内容检索的实战教程
文章围绕Qwen3-VL-Embedding-8B模型展开,介绍其核心特性、技术架构等,提供环境搭建、模型部署指南,给出文搜图系统架构及代码实现,还通过电商、社交媒体、企业文档三个实战案例展示应用,最后讲解性能优化与常见问题解决方法。
从Claude隐形水印回望GenAI时代信息隐藏:嵌入水印如何保证无损?
2026年Anthropic新版Claude模型嵌入隐形水印,引发对水印是否伤模型的质疑。可证安全隐写理论为解决此问题提供支撑,中科大等团队取得诸多成果,将“可证无损”从内容延伸到模型,还探讨了水印攻防。
LeCun离职前的吐槽太猛了
年底将离开Meta的LeCun在播客直言,不看好大语言模型通往AGI,也吐槽Meta封闭。他将创办开源公司AMI研究世界模型,认为其与LLM本质不同,还回顾AI学习史引出JEPA架构。
端侧AI从「能跑」到「会进化」,元空智能跑进惠普预装
北大出身的创业团队元空智能,提出大模型静态互联网数据红利见顶,端侧是下一轮能力跃迁核心,重新定义端侧AI为「模型×Agent×设备」,发布Boxer端侧模型与两款Agent产品,其端侧AI已拿下惠普商务电脑预装,实现规模化落地。
扩散语言模型深度思考
作者探讨扩散语言模型(dllm),认为其建模方式或冲击AR。团队在AAAI报告介绍多项工作,还整理当前diffusion问题及观点,如推理架构、词表、优化范式等,并附项目网站和agent demo。