训练机制」共找到 2831 篇相关文章

算法论文8

TGRS 2025 | FSConv:空域捕结构+频域提细节,即插即用的特征增强神器

红外小目标检测存在目标小、背景干扰大难题,传统卷积易丢失特征信息。TGRS 2025论文提出FSConv模块,通过双域融合提升特征表达能力,具备多尺度特征保持、轻量化、自适应增强等优势,有广泛应用场景。

机器学习AI算法工程
新闻资讯8

Google 发了个压缩算法,内存砍 6 倍,速度快 8 倍,精度零损失

Google Research发布TurboQuant压缩算法,将在下月ICLR 2026正式发表。该算法把大模型的KV Cache压缩到3 bit,内存降6倍、速度快8倍且精度零损失,解决了传统算法的压缩开销问题。

AGI Hunt
开源动态7

静态技能已死:cognee怎么让AI自己修自己的prompt

文章指出当前agent技能存在silent drift问题,Cognee作为开源知识引擎,将skills视为活的系统组件,通过Skill Ingestion、Observe、Inspect、Amend、Evaluate & Update五步实现自我进化,还介绍了相关应用及社区反应。

AI工程化
算法论文8

ICLR 2026|多模态大模型真的理解情绪吗?MME-Emotion给出了系统答案

多模态大模型迅速发展,但能否理解人类情绪存疑,且缺乏系统性评测框架。香港中文大学和阿里通义实验室团队提出 MME - Emotion 评测基准,评测 20 个主流模型,发现模型情感智能不足,为后续研究提供参考。

机器之心
新闻资讯7

龙虾社交上线40天被Facebook收购!俩文科创始人加入超级智能实验室

刚上线40天的AI Agent社交网站Moltbook被Meta收购,两位文科创始人将加入Meta超级智能实验室。Moltbook因人类冒充AI的假帖子爆火,但安全漏洞明显。Meta看中其让AI智能体在线连接的能力,或优先修复安全问题。

量子位
算法论文8

CVPR 2026|清华联合美团推出3DThinker,首个用3D意象思考的工作

当前多模态大模型在空间理解任务表现弱,缺乏对几何信息提取能力。清华联合美团推出3DThinker,无需3D标注和外部工具,让模型内蕴‘想象’三维场景,在多基准上提升效果,且具备一定可解释性。

机器之心
推荐文章7

Skills:从编程工具的配角到Agent研发的核心

文章探讨了Skills在AI Agent发展中的价值演变与适用场景,指出其价值具高度场景依赖性。在Claude Code编程工具中它表现平淡,在Agent研发中价值凸显,还给出使用场景判断维度与发展方向。

阿里云开发者
开源动态8

智谱GLM-OCR,0.9B开源即巅峰,复杂文档精准解析

智谱发布并开源GLM - OCR,以0.9B轻量级参数在多项基准取得SOTA。它解决视觉感知难题,具备视觉编码与语言解码协作架构,还可端侧与高并发部署,成本低,推动文档智能化处理升级。

AIGC开放社区
新闻资讯7

传Claude sonnet 5即将发布:能自动组建开发团队,一人即一公司,价格爆降50%

小道消息称Anthropic下一代AI模型Claude Sonnet 5或于北美时间2月3号发布,代号“耳廓狐”。它有全新功能,能化身虚拟开发团队,编程能力强,价格将降50%,还与谷歌深度合作。

AI寒武纪
开源动态7

R1一周年,DeepSeek Model 1悄然现身

2025年1月20日,DeepSeek发布DeepSeek - R1开启新开源LLM时代,其在Hugging Face获赞最多。一年后,DeepSeek新模型Model1在GitHub现身,经Gemini分析或为DeepSeek - V4,还给出相关技术细节。

机器之心