「编程测试」共找到 2639 篇相关文章
GPT-6 Astra 正式登场:烧了 10 万块 GPU、多项跑分逼近满分,OpenAI 总裁:我们迎来 AGI 时代
今天凌晨,OpenAI正式发布GPT - 6 Astra。它多项跑分逼近满分,OpenAI总裁称其或意味着AGI时代开始。该模型在多方面能力领先,安全措施升级,将在‘未来几天’面向部分用户推出。
把PLC仿真搬进浏览器,小参数模型也能实现高工程通过率
上海交通大学联合Sema研究团队推出SemaPLC,将AI Agent与PLC工程工具链连接,让自然语言需求转化为可编译、验证、仿真的控制程序。它是面向全流程的智能工作台,实验效果优于业界方案。
临时文件自动归档工具|解放双手,杂乱文件自动整理归档!
乡长分享基于AutoHotkey V2等4种AI工具开发的临时文件自动归档工具,可解决文件混乱问题。它能监控指定文件夹,自动搬运归档符合条件的文件,新版本功能强大,操作简单。
不换模型,效果提升104%!上海AI Lab让Harness也能自进化了
上海人工智能实验室团队提出的Self-Harness引发关注,它针对Agent外层Harness改进。实验显示,在Terminal-Bench-2.0上,不换模型只改Harness,Qwen3.5-35B-A3B等模型效果显著提升。
比英伟达早,比李飞飞强,大晓Kairos原生一体化世界模型定义物理AI新路线
大晓机器人发布 Kairos 开悟世界模型,其首创“多模态理解 — 生成 — 预测”原生一体化架构,采用跨具身渐进式训练体系和“以人为中心”的数据金字塔,还实现端侧部署,在四大权威具身智能基准上全面登顶。
Claude Code发布Agent View,多任务流的ADHD患者有救了
Claude Code发布Agent View,它像给Claude Code的tmux,能将多个Claude会话状态分类展示,帮用户分配注意力。它把Anthropic内部工作流产品化,有会话与窗口解绑、工作树隔离等设计。
Anthropic 那个“强到不敢发”的模型,终于来了!
今天凌晨,Anthropic 发布新模型 Claude Mythos Preview,它曾被指‘强到不敢发’。该模型能力跃升,尤其网络攻防能力突出,但因具‘双重用途’仅向少数伙伴开放,用于防御性网络安全项目。
跨越智能体落地的可信鸿沟:玄甲(AgentWard)全链路防御操作系统正式发布
大模型向自主智能体演进,安全威胁全域化。当前安全方案有局限,制约产业落地。清华大学团队推出玄甲全链路安全防御操作系统,构建五层纵深防御体系,已落地应用,降低安全事件发生率,筑牢安全防线。
开源一周狂揽 7.6K Star!这个爆火的「同事.skill」可以将“数字遗产”炼成 AI!
开源项目colleague-skill上线不到一周获7600+ Star。它由@titanwings开发,可凭同事材料生成能替其工作的AI Skill,有双层架构、多源采集等亮点,还介绍了使用方法与项目结构。
从视觉出发统一多模态!颜水成团队最新研究:不再把图像编解码器塞进LLM|ICLR'2026
NVIDIA研究员Jim Fan称AI正经历第二次预训练范式转移。颜水成团队Muddit模型从视觉先验出发,用离散扩散框架统一文生图、图生文和VQA,挑战多模态“语言中心论”,在多任务表现出色。