「中科大」共找到 6830 篇相关文章
当SFT遇上RL:基于样本学习阶段的动态策略优化机制
在大模型推理能力增强研究中,SFT和RL两种后训练范式难有效融合。研究团队提出DYPO动态策略优化方法,先判断样本学习阶段再匹配优化路径,在多场景实验中表现出色,不过有实验边界。
追赶OpenAI!Anthropic 融资 130 亿美元,估值 1830 亿美元
Anthropic完成130亿美元F轮融资,投后估值1830亿美元。其收入增长快,Claude Code产品表现佳,但约28%收入依赖两大客户。豪华投资方助力扩产等,它正追赶OpenAI,不过竞争挑战大。
你敢把「龙虾」放在手机上跑吗?手机 Agent 离落地还差一道「隐私关」
港中深联合腾讯混元研究揭示,手机 Agent 落地关键不在成功率,而在隐私边界。研究设计隐私交互协议,构建模拟 App 记录过程,将常见越界行为归类检查,评估多个模型发现诸多隐私问题。
刚刚,LMArena最新模型榜单出炉!DeepSeek-R1网页编程能力赶超了Claude Opus 4
LMArena最新模型榜单出炉,DeepSeek - R1(0528)表现亮眼。在文本基准测试中整体排第6、开放模型中排第一,细分领域也成绩优异,在WebDev Arena平台与闭源大模型并列第一,超Claude Opus 4。
“我可能不再建议学计算机”!图灵奖得主炮轰半个行业,并断言:AI Agent最后全是数据库问题
图灵奖得主 Mike Stonebraker 在访谈中炮轰数据库行业,直言计算机科学未来或不再是增长型行业。他批判 Oracle、Google、AWS 等公司的数据库方案,还指出大模型写 SQL 在真实数据仓库中准确率极低,agentic AI 未来将成数据库问题。
告别微调!斯坦福提出Agentic上下文工程
当前微调大语言模型成本高、不灵活,‘上下文适应’方法有短板。斯坦福大学等提出ACE框架,将上下文变为动态‘战术手册’,解决现有问题。论文通过实验验证其在性能、成本和效率上优势,为大模型发展指明新方向。
中国芯片就差一台EUV
中国芯片代工取得佳绩,全球前10大晶圆代工厂中大陆占3个。但与台积电差距大,核心在于缺EUV光刻机。9位业内大佬联名呼吁造中国版ASML,国家也将推动产业链协同攻克此技术。
3B激活参数!商汤绝影Sage登顶PinchBench,端侧第一
商汤绝影Sage端侧大模型在PinchBench评测中,以94%任务完成率超越Claude、GPT - 5.4等主流大模型。它激活参数仅3B,算力需求低,还具备多项实用场景能力,靠SCOUT和ERL两项自研技术提升性能。
账上仍有30亿元现金,王小川不下牌桌|甲子光年
1月13日百川智能开源新一代医疗大模型Baichuan - M3,在医疗AI评测中夺冠,超越GPT - 5.2。王小川带领百川转型AI医疗,虽面临挑战但账上有30亿现金,选择院外商业化,预计2027年考虑上市。
奥特曼爆料:GPT-5重构彻底一切!一人顶五个团队
GPT-5的发布或是一场技术变革。奥特曼在对谈中给出未来清单,谈到年轻人学习方向、创业思路等。他认为GPT-5是大飞跃,年轻人要掌握AI工具,还提出评估大模型智力新指标等。