「参数压缩 - 覆盖假说」共找到 1208 篇相关文章
谷歌Transformer过时了?清华姚班校友等三连击,爆改注意力!
谷歌提出新架构,参数减少40%,训练速度较RNN提升5 - 8倍,某些任务性能超Transformer 7.2%。新架构引入注意力偏向策略,用「保留」取代「遗忘」,还提出Moneta、Yaad、Memora三个新模型,在多任务上表现卓越。
硅谷热议:最快语音转文字模型
AI语音独角兽ElevenLabs发布Scribe v2 Realtime实时语音转文本模型,实现150毫秒超低延迟、93.5%高准确率,覆盖90多种语言,打破速度与精度不可兼得困境,此前该领域痛点多。
美团又上新模型,8个Thinker齐开工,能顶个诸葛亮?
临近春节,美团 1 月 15 日更新 LongCat - Flash - Thinking - 2601 模型。它有 5600 亿参数,引入重思考模式,智能体能力提升。实测表现佳,适合特定场景,其技术改进独特,还将推出 ZigZag Attention。
DeepSeek-OCR是「长文本理解」未来方向?中科院新基准VTCBench给出答案
DeepSeek - OCR的VTC技术可实现高压缩率,降低长文本处理成本。但视觉语言模型能否理解压缩信息存疑,中科院等推出VTCBench评估,测试模型认知极限,还推出VTCBench - Wild检测鲁棒性。
又一个Kimi K3下周开源!Qwen3.8-Max编程、办公、科研都能自己干了
Qwen3.8-Max是Qwen家族迄今最强模型,2.4万亿参数,下周将开源权重。它在多项基准测试中表现出色,能连续自主工作数天,在编程、办公、科研、长周期任务、多模态等方面全面提升。
这家公司,“杀死”了他们的 AI 应用
脸谱心智(FaceMind)虽未关停「叠叠社」AI 应用,但开始押注底层世界模型研究。其论文提出 Looped World Models,带来 100× 参数效率提升,强调 AI 可靠更深内部推演获得能力,指出只做应用不够。
本地无限画布,把AI创作玩出了新高度!
传统AI生图工具使用有局限,缺乏自由组织的畅快感。Infinite - Canvas是本地无限画布工具,支持多种生成后端,有普通和智能两种画布模式,具空间自由、覆盖不同用户等优势,还提供上手教程。
算力不再稀缺?中国AI芯片供给出现反转
过去中国AI产业常焦虑算力不足,如今国产AI芯片进入集中交付阶段,自给率提升。伯恩斯坦测算,国产化率有望从2023年约17%提至2027年约55%。产业进入新阶段,竞争从“拼参数”转向“拼体系”。
零一万物高管新阵容亮相,李开复加码布局ToB 2.0
零一万物ToB战略加速落地,公布新一轮高管任命,沈鹏飞、赵斌强、宁宁三位核心管理者亮相。其“一把手工程”依托万智平台,已覆盖多行业,在国内外均有合作成果,目标是让AI成企业转型推动者。
别怀疑,就是这么强!!!13.7k Star Casdoor,爽爽爽爽爽~~~~
Casdoor是可自己部署的IAM/SSO服务端,像“身份门”,一次认证后将多种身份管理功能集成。它协议覆盖广、能衔接认证与权限管理等。但使用时也得认真治理,避免越权问题。