「00后团队」共找到 4981 篇相关文章
全球排名前三,复旦自进化Harness Engineering让GPT‑5.4再涨7个点
2026 年以来,Harness Engineering 成业界热词。复旦大学等团队提出 Agentic Harness Engineering (AHE),可实现 Harness 自动优化。实验中,AHE 让 GPT - 5.4 分数提升,适配 GPT - 5.5 后排名全球第三,且有良好泛化能力。
Claude写完代码不直接交了:4个Skill自查一遍,改好再找你
Anthropic将AI验收纳入循环,让Claude写完代码后进行四道检查才交付,定义了验证循环,Claude Code团队有4个自查Skill,还介绍了写验证Skill的方法、触发设置,AI编程竞争正从生成转向验证。
DeepSeek们越来越聪明,却也越来越不听话了。
论文《When Thinking Fails: The Pitfalls of Reasoning for Instruction - Following in LLMs》用实验验证,模型推理能力变强时,提示词遵循能力变差。研究团队对15个模型测试,发现用CoT推理后执行准确率下降,还提出4种提升指令遵循效果的方案。
智谱公布“降智”的秘密:Scaling不可避免的痛
智谱最新技术博客大倒苦水,称从GLM - 5以来遭遇「Scaling Pain」。团队排查出高负载下推理状态管理等问题致异常,还给出避坑指南,如在线异常监控策略,优化后系统更稳定,吞吐量提升。
风投的钱,开始由AI科学家重新分配
近年新型AI公司NeoLab兴起,获风投后开始资助外部科研。如Thinking Machines Lab、Periodic Labs推出资助项目。NeoLab先定研究问题再选团队,决策快,虽有积极一面,但也可能使少数人影响研究走向。
一夜之间,AI终获「永久记忆」!最难考试99%刷爆SOTA,全网直呼疯狂
新智元报道,Supermemory团队推出超级记忆系统ASMR,在AI记忆界最难考试LongMemEval中刷到99%准确率。它抛弃传统模式,采用多Agent并行推理,4月初将开源代码。此外,其背后的Supermemory引擎功能强大,能让AI真正拥有记忆。
斯坦福华人天团意外爆冷!AI用纯CUDA-C编内核,竟干翻PyTorch?
斯坦福华人团队用纯CUDA - C编写的快速AI生成内核超越PyTorch,成果登上Hacker News热榜。研究者采用KernelBench任务设置,引入新优化方法,实验显示多数最优内核在靠后轮次出现,优化策略集中在几类常见模式。
Qwen3又又又发布了新模型~~~
Qwen3团队继发布`Qwen3-235B-A22B-Instruct-2507`和`wen3-235B-A22B-Thinking-2507`后,又发布`Qwen3-Coder-30B-A3B-Instruct`。该简化模型性能和效率出色,有多项关键增强功能,且是非思考模型,输出效率高。
给机器人一个会预测未来的Critic,VLA强化学习直接起飞
OpenMOSS团队开源的World Critic Model(WCM),解决了视觉 - 语言 - 动作模型强化学习(VLA - RL)中批评家模型(Critic Model)仅依赖单帧观测打分的问题。WCM让Critic学习预测执行动作后的潜在状态,代码等全开源,验证效果显著。
小米罗福莉:MiMo-V2.5如何做到又快又强又便宜? | ICML 2026
2026年7月ICML大会上,小米MiMo团队负责人罗福莉介绍MiMo - V2.5系列。该系列跳出传统思路,从架构、训练、推理协同设计,实现“聪明、快速、便宜”,如预训练降成本、后训练有硬核算法、推理加速达1000 TPS。