「自监督模型」共找到 8291 篇相关文章
模仿人类推理修正过程,阶跃星辰提出形式化证明新范式 | 开源
阶跃星辰发布并开源形式化定理证明大模型 StepFun-Prover-Preview-7B 和 32B。采用两阶段监督微调、工具集成强化学习及 RL 与 SFT 迭代循环优化等策略,在基准测试集表现佳,还展示多个证明案例。
千人千面的真人级AI名师,劈开教育「不可能三角」
与爱为舞推出的AI导师能个性化教学,服务百万用户。其用「模型+语音+工程」铸造技术巨剑。经训练,AI可驾驭课堂,再经自研语音模型实现交互,通过链路优化等实现规模化落地,践行「全员皆超级个体」理念。
LLM加RL遭质疑:故意用错奖励,数学基准也显著提升,AI圈炸了
华盛顿大学等机构论文引爆AI界,其发现用虚假奖励训练Qwen2.5-Math-7B模型,也能提高MATH - 500成绩。虚假奖励对Qwen模型有效,但在其他模型上有限,凸显RLVR有效性与模型能力有关。
都标5美元,账单差三成!OpenAI高管:token从来没法直接比价
OpenAI Codex负责人Tibo指出,不同模型对同一段文字切分的token数不同,即便单token价格相同,最终账单也可能差异很大。他还提到,token无统一计量标准,跨厂商和新旧模型计数都难通用,真正重要的是每次成功结果的成本。
3B激活参数!商汤绝影Sage登顶PinchBench,端侧第一
商汤绝影Sage端侧大模型在PinchBench评测中,以94%任务完成率超越Claude、GPT - 5.4等主流大模型。它激活参数仅3B,算力需求低,还具备多项实用场景能力,靠SCOUT和ERL两项自研技术提升性能。
deepseek v4.1? 梁圣的端午礼物突袭。
群里小伙伴称deepseek官方灰度新模型,手机和web端Flash模型思考模式大变,典型bug修复。测试发现幻觉严重,知识库截止大概25年6月。同时,deepseek获500亿首轮融资,梁文锋自掏200亿,投资方无投票权,五年锁定期。
刚刚,DeepSeek多模态技术范式公布,以视觉原语思考
DeepSeek发布多模态模型并公布技术报告,提出‘以视觉原语思考’。该模型解决多模态大模型‘指代鸿沟’问题,有把坐标变思维单元、7056倍视觉压缩、精心设计冷启动数据等创新,实验在多任务上超主流模型。
深度体验DeepSeek Harness,我原谅它涨价了
本文深度体验了DeepSeek Harness,它已发布并开源代码。其一切如模型、工具等皆为可插拔积木,官方内置超百个插件。介绍了安装方法、使用特点,还对比了与Codex差异,认为它是Agent时代的安卓,有望推动自进化。
MLLM集体翻车,缺乏婴儿级常识!业界首个核心认知基准发布,LeCun转赞
当前大模型在12项核心认知上普遍落后人类10 - 30%,越大的模型越易靠「背答案」糊弄。团队公开首个系统评测框架和题库,用Concept Hacking方法识破模型真假理解,指出模型存在核心知识缺失等问题。
NVIDIA港大MIT联合推出Fast-dLLM v2:端到端吞吐量提升2.5倍
自回归大语言模型推理效率受限,Fast - dLLM v2 由 NVIDIA、港大、MIT 联合推出。它将预训练 AR 模型适配为能并行解码的 Block - dLLM,用约 1B tokens 微调,端到端吞吐量最高提升 2.5 倍,精度相当。