「小语言模型」共找到 8377 篇相关文章
Adaptive Reasoning Model:Qwen3混合思考->字节AdaCoT->清华AdaThinking
文章介绍三种处理混合思考模式的方法,阿里 Qwen3 通过 SFT 让模型具备思考能力,但需人为控制;字节 AdaCoT 和清华 AdaThinking 让模型自主决定是否思考,分别用多目标优化和受限优化目标训练。
大模型最后一层竟是推理累赘?绕开对齐税,奥数准确率暴涨 22.4%!
Qwen团队、清华和南洋理工研究打破传统认知,揭示‘对齐税’现象。提出Confident Decoding策略,在多架构和评测集实验中表现出色,开销低,挑战‘LLM最后一层最优’常识。
小扎噩梦来了!MSL两月爆雷8人闪辞,PyTorch元老出走实验室人心崩盘
Meta的超级智能实验室(MSL)成立仅两月,至少八位核心员工离职,不乏PyTorch元老和新招募的硅谷天才,部分直奔OpenAI。内部重组频繁、战略摇摆,Meta AI大计或翻车。
8.6K star!!实时翻译、离线使用、支持50+语言,这个免费开源项目牛皮!
介绍开源项目RTranslator,它为Android平台实时翻译应用,用Meta的NLLB模型与OpenAI Whisper技术,本地处理保障质量与隐私。有双模式对话等功能,在Github获8.6K star。
专业医生远不如AI模型?OpenAI推出医疗开源测试基准HealthBench,o3表现最强
OpenAI推出医疗开源测试基准HealthBench,由262位多国医生合作打造,含5000段真实健康对话。评估显示o3综合表现最佳,顶尖AI处理任务能力超无辅助医生,HealthBench更真实专业有区分度,但也有局限。
免费AI办公套件真香,节省一大笔会员费
Genspark团队开源AI办公套件GenOffice,全平台免费无广告。它界面类似微软Office,零成本上手,AI能直接编辑文档。虽处Alpha阶段,但可切换多种模型,还给出了配置第三方模型的方法。
ICML 2025|如何凭「自动补全」实现100K生成3×加速?
在大模型推理复杂的当下,生成超长文本成本高。BIGAI NLCo团队提出推理加速框架TokenSwift,被ICML 2025接收。它重构传统自回归推理,解决长生成瓶颈,在多模型实验中表现亮眼。
来自MIT最强AI实验室:OpenAI天才华人研究员博士毕业了!
OpenAI华人研究科学家陈博远完成MIT博士论文答辩。他不到4年读完博士,辅修哲学,是GPT图像生成核心成员和Sora视频团队成员,将推进世界模型技术,强调视觉世界模型对具身智能至关重要。
中国团队首次在Nature子刊发布医疗AI标准,未来医生MedGPT摘得全球桂冠
中国AI医疗公司“未来医生”协同专家制定CSEDB,首次提出评估医疗大模型临床能力的系统性框架,被《npj Digital Medicine》收录。在其评估下,未来医生的MedGPT在主流大模型中夺冠。
看懂这篇,你就能秒懂 LLM底层秘密—Transformer原理解析
文章由浅入深介绍LLM基础知识,着重解析Transformer原理,结合案例讲解其工作流程,还介绍当前开源旗舰LLM架构变化,如DeepSeek V3等模型的创新,最后强调模型能力与应用形态的关系。