「预训练视觉表征」共找到 2642 篇相关文章
该工作引来马斯克回复,让Gork破防:CoT是真正的推理,还是训练数据的统计插值?
大型语言模型(LLMs)的思维链(CoT)推理能力被视为突破性进展,但论文揭示CoT可能只是数据分布内的模式匹配幻象,通过实验证明其在分布偏移时表现急剧退化,挑战主流认知。
ICCV 2025 | 跨越视觉与语言边界,打开人机交互感知的新篇章:北大团队提出INP-CC模型重塑开放词汇HOI检测
北大团队提出 INP - CC 模型重塑开放词汇 HOI 检测。它提出交互感知提示生成和概念校准两项创新,结合输入图片特性构造提示集合,引入‘困难负样本采样’策略,在两大数据集上表现超 SOTA。
训练数据爆减至1/1200!清华&生数发布国产视频具身基座模型,高效泛化复杂物理操作达SOTA水平
清华大学与生数科技联合研发Vidar模型,首次让通用视频大模型长出‘手脚’,实现从虚拟到真实世界物理执行的跨越。它降低数据门槛,突破跨本体泛化困境,为服务机器人应用奠定基础。
万人见证,“出轨”CEO被停职;陶哲轩评“OpenAI内部实验模型获IMO金牌”;传字节Seed视觉负责人“暂休”|AI周报
这是一篇AI行业周报,涵盖多领域热点。如Manus季逸超复盘Agent研发经验;陶哲轩评OpenAI模型获IMO金牌;字节跳动绩效改革、人员变动;还有企业动态,像英伟达黄仁勋访华、宇树科技开启上市辅导等。
深谋科技独家发布真正为人类服务的新一代人形机器人核心技术「声波传感 · 意念控制 · 高精视觉 · 类脑智能」
2025世界人工智能大会7月将举行,深谋科技作为精英合作伙伴参展。其秉持服务人类理念,携系列核心技术亮相。有独创传感系统、脑机交互方案等,还将推通用具身智能世界模型。
单张消费级显卡也能参与大模型训练!无问芯穹用「三个盒子」打通十万卡到一张卡AI效能跃升路径
2025年WAIC上,无问芯穹联合创始人夏立雪带来AI落地新解——三个盒子,即无穹AI云、无界智算平台、无垠终端智能,是面向未来的智能基础设施设计,能打通从十万卡到一张卡的AI效能跃升路径。
国外网友疯传DeepSeek R2/R3/R4 炸裂突破,超越传统的「跨因果超矩阵」,并在训练过程中自发产生了R5……
国外网友疯传DeepSeek R2到R5的“重磅”消息,爆料内容层层递进且玄幻离谱。Anthropic联合创始人评价有认可也有轻视。当下闭源模型各领风骚,开源阵营期望集中在DeepSeek R2,应平常心看待传言。
Kimi K2基于DeepSeek V3构建
从Hugging Face模型配置文件可知,月之暗面未设计全新模型结构,而是选Deepseek V3作基座模型,用自身高质量数据、独特方法做大量‘微调’和‘后训练’。
Anthropic联创公开劝退套路码农!94%编程将被接管,去学点哲学吧
Anthropic联创Jack Clark在峰会上称大学生应避开「套路化编程」,未来需跨学科综合、分析思考能力。Anthropic雇哲学家训练Claude,工程师工作转向管理AI智能体,AI接管编程趋势明显。
SRO赋能Qwen-2.5-VL推理性能飙升16.8%
文本领域推理模型成就大,但多模态大型语言模型推理能力扩展遇阻,如冷启动初始化不足等。提出SRO三阶段训练框架,经测试,ReVisual - R1平均性能提升16.8%。