「人工超级智能」共找到 3736 篇相关文章
ACL 2025 | 指令遵循不能仅靠常识?GuideBench 揭示大模型如何“踩雷”领域指南规则
这篇ACL 2025主会论文聚焦提升智能体指南规则遵循能力。提出评估基准GuideBench,涵盖7类1272个任务。实验显示多数主流大模型指令遵循能力不佳,尤其数学推理挑战大,为模型迭代提供评估基准。
The Batch:841 | 大语言模型正在纠正历史遗留的不公
美国北加州旧不动产契约含种族歧视条款,人工筛查耗时久。斯坦福和普林斯顿大学研究人员微调大语言模型实现自动识别,分析圣克拉拉县契约,发现诸多受影响土地,且揭示少数开发者推动住房隔离,模型已开源。
无需标注和奖励模型!仅靠自信度RL,16个样本训练20步,效果飙升21%!
论文提出RLSC,让大语言模型用自身答案置信度作奖励信号,摆脱人类标注依赖。它以模型自信度内部信号替代多数投票外部信号,小成本提升模型数学能力,还让模型学会快推理,不过也存在安全隐忧。
一分钟做3D音符版“跳一跳”,Flowith成通用Agent新“必玩王者”丨TIP 003
Flowith作为较早出海的AI产品,以自由画布+通用Agent组合出圈。其Neo版本技术功能强,产品服务有亮点,如不限DeepResearch任务、以人为主的智能代理、回答速度快等,虽有不足但未来值得关注。
狂揽20.2k星!还在傻傻的写SQL吗,那你就完了!这款开源项目,让数据分析像聊天一样简单?再见吧SQL
开源项目PandasAI让数据分析像聊天一样简单,由Sinaptik AI团队打造,将ChatGPT级自然语言处理能力注入Pandas。它有对话式分析、智能图表生成等亮点,适用于多场景,还给出使用步骤及与同类工具对比。
绝对零监督Absolute Zero:类AlphaZero自博弈赋能大模型推理,全新零数据训练范式问世
清华大学 LeapLab 团队等提出全新推理训练范式 Absolute Zero,使大模型实现「自我进化式学习」。基于此范式训练的模型 AZR,在代码生成与数学推理基准任务表现出色,缓解了大模型对人工数据依赖难题。
协和4+4的另一面:浙江范式用AI定义医疗未来!AI「智愈」时代来临
一场关于协和“4+4”的热议引发医疗未来之问,浙江从医院、企业、政府三重维度,以浙大二院、德适生物、安诊儿等为例,展示AI在医疗领域的应用,构建未来医疗图景,推动医疗从“治病”走向“智愈”。
2025年4月17日消息,OpenAI 连发o3和o4 mini,o3为强大推理模型,o4-mini专为高效推理优化。它们能调用ChatGPT工具,可基于图像思考。OpenAI还开源本地代码智能体Codex CLI,兼容所有模型。
基础杂活全被一键秒杀,还要初级员工干嘛?Google Research负责人:以往熬15年的判断力,现在一出道就得硬抗
本文为Google Research全球研发副总裁Yossi Matias的官方播客访谈,分享了Google在生成式AI、AI加速科研、行星级智能、量子计算等前沿方向的探索,探讨AI替代基础工作后对人才能力要求的变革。
刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代
OpenAI官宣下一代旗舰模型GPT - 6 Astra,定义其为「世界上最智能、对齐程度最高」的模型。它多项基准测试成绩惊人,在编程、计算机使用等多领域表现卓越,还改写科研纪录,不过因安全能力强暂未全开放。