「可验证性」共找到 4894 篇相关文章
国产MiroMind智能体框架,登顶全球预测未来大模型榜单
国产MiroMind公司在全球首个动态实时预测基准FutureX上夺冠,老板是陈天桥。其开源的MiroFlow v0.2智能体框架优势明显,能升级大模型能力,且成本低、可复现。MiroMind在预测赛道领先。
GPT-5难产内幕曝光!核心团队遭挖空,推理魔咒难破,靠英伟达续命
外媒The Information曝出GPT-5诞生内幕,其未取得技术突破,OpenAI面临数据瓶颈与技术难题,核心研究者被撬导致组织架构混乱。不过,OpenAI获巨额融资,推理模型成突破口,还在开发“通用验证器”。
陶哲轩,用AI爆改科研范式
菲尔兹奖得主陶哲轩让ChatGPT把数学论文翻译成Lean代码,与AI合作完成埃尔德什第613号问题反例的形式化证明。人机配合虽有波折,但AI节省了时间。此外,两位数学家也用AI验证第707号问题反例,数学证明正进入‘AI辅助时代’。
鼠标的未来是手环?解码肌肉信号,Meta黑科技登上Nature
Meta推出非侵入性神经肌肉交互系统,利用手腕表面肌电图(sEMG)实现人机交互,该技术登上7月24日的Nature。实验在连续手势控制、离散手势控制和打字三个任务评测效果不错,适合特殊人群,也能弥补脑机接口数据不足。
百度文库网盘,押注工作流里的超级智能|甲子光年
4月27日百度文库网盘在AI DAY发布通用智能体GenFlow4.0,展示融合OpenClaw新进展。它让AI介入办公软件,引入Agent参与团队协作,从单兵作战到全向协同,解决办公中间工作,靠数据、系统和用户验证构建系统工程。
花了几百万办完一场AI大会后,想跟你分享这6个感悟。
作者分享举办AI大会的6个感悟,指出AI强大时线下真实更重要。如AI可消灭信息差但压缩不了体验差,品味是活出来的,线下交流能带来偶然性等,鼓励人们去线下获得真实体验。
腾讯混元团队最新研究:让 AI 从「固定模型」走向「实时适配系统」
腾讯混元团队提出论文《HY-WU (Part I)》,尝试让模型在推理阶段根据输入实时动态生成适合任务的参数,而非依赖固定参数。通过多类实验验证,这种方式在图像编辑等任务中有明显优势,还降低了训练复杂度。
跑分第一,实战拉胯!GPT Image 1.5被骂惨,奥特曼这波悬了
OpenAI推出新一代旗舰图像模型GPT Image 1.5,生图能力强,免费用户可上手,开发者能调用API。它在跑分榜单成绩优异,但网友实测发现是‘高分低能’,引发吐槽。此外,其API价格降20%,此次更新是回击谷歌。
别让米其林主厨削土豆!英伟达用「小脑指挥大脑」,重构AGI生产力
英伟达推出8B模型Orchestrator,通过组合工具降本增效。在HLE等测试中超越GPT - 5,成本仅为其30%左右。它还能泛化到未见工具,具有可定制调度能力,标志着复合AI新范式的兴起。
抖音&LV-NUS开源多模态新模,以小博大刷新SOTA,8B推理比肩GPT-4o
抖音SAIL团队与LV - NUS Lab联合推出多模态大模型SAIL - VL2,以中小参数规模在106个数据集实现性能突破。该模型从架构、数据、训练三方面创新,后经全链路优化,在多数据集验证中表现卓越。