「完全自训练」共找到 3169 篇相关文章
大模型的第一性原理:(二)信号处理篇
本文从信号处理角度解读大模型原论文,探讨语义向量化原理,分析 Transformer 与 Granger 因果关系。指出大模型输入 Token 语义嵌入是将自然语言处理转化为信号处理问题,向量化与信号处理、信息论联系紧密。
解决算力瓶颈,给多模态瘦身!Token压缩完整图谱与选型指南
给多模态大模型瘦身是解决算力瓶颈的关键。Token压缩技术可剔除视觉冗余,提升训练与推理效率。北大等团队剖析其全貌,给出完整图谱与选型指南,还揭示了未来演进路径。
多模态大模型中Attention机制暗藏「骗局」,需用一个公式修正丨上大×南开
上海大学曾丹团队研究发现,主流VLM中attention受位置偏置和padding区域异常高attention影响,直接用其进行视觉token剪枝会丢失关键信息。团队用公式对attention去偏,集成到多种剪枝方法,提升了模型性能。
没博士没论文,这些人靠什么「野路子」杀进OpenAI等顶级AI大厂?
OpenAI资深研究科学家Noam Brown分享几个真实故事,展示无传统学术履历者进顶级AI大厂的途径,如改进他人论文、发起公开项目、自行发表论文等,还提及本科生机会及薪酬等问题。
GPT-5.3爆更前夜,全网都被一张图吓到!ChatGPT人格大赏
OpenAI华人研究员Joanne Jang一条推文引发ChatGPT生图玩法热潮,它能根据聊天记录生成反映‘待遇’的自画像。近期ChatGPT记忆功能优化,已向全球Pro和Plus用户推出。还有爆料称GPT - 5.3要来了。
通用级PixVerse P1的技术突破,揣着进入平行世界的密码
PixVerse R1 突然上线,带来「即时响应、即看即创」新体验。它是全球首个支持最高 1080P 分辨率通用实时世界模型,实现从「静态输出」到「实时交互」跨越,本文将解析其技术突破。
世界最强医疗模型百川M3发布:AI医疗,奇点已至
百川智能发布并开源全球最强医疗模型Baichuan - M3,各项指标SOTA且超越人类医生平均水平。它告别机械‘背医书’,学会主动追问、排查病因,解决AI‘胡说八道’问题,准确度超GPT - 5.2 - High。
清华突破「光毒性」难题,活体显微进入无扰观测时代
清华大学团队研发出LF-denoising自监督去噪算法,可在超低光毒性下实现长时间高保真三维亚细胞成像,突破了长时间活体成像的光毒性限制,为多领域研究提供新工具。
大模型最难的AI Infra,用Vibe Coding搞定
Andrej Karpathy 力荐的 Vibe Coding 在 AI Infra 开发中常「水土不服」,存在上下文丢失、决策偏离、质量不稳定等问题。文章提出文本驱动的 Vibe Coding 方法,并以 Agentic RL 中的资源调度系统为例验证其有效性,还介绍了相关团队和工具。
独家解读|2025年AI五大趋势与底层数据革命
2025 年 AI 发展重心转移,高质量数据成新基石。本文解读五大技术趋势,如多语种 TTS 与全双工交互、多模态大模型等,还介绍了各趋势的数据需求及数据堂提供的相应数据服务方案。