「实时世界模型」共找到 8110 篇相关文章
高考数学斩获139分!小米7B模型比肩Qwen3-235B、OpenAI o3
2025高考落下帷幕,人工智能领域多家大模型挑战数学卷。小米7B参数的MiMo - VL模型考139分,比肩Qwen3 - 235B、OpenAI o3,还在多方面表现出色,技术报告等已开源。
GPT-5.2考赢人类!OpenAI警告:大模型能力已过剩,AGI天花板不是AI
GPT - 5.2在ARC - AGI - 2基准测试超人类,Poetiq系统让其准确率从60%提至75%。OpenAI称大模型进入‘能力过剩’阶段,未来AGI进展不止靠模型,更需人机协同。
设计师集体沸腾!阿里开源千问图像编辑模型,支持语义及外观的双重编辑!
阿里Qwen团队于2025年8月18日发布Qwen-Image-Edit模型,基于20亿参数的Qwen-Image模型,结合Qwen2.5-VL和变分自编码器,支持语义及外观双重编辑,能精准修改文字,已上线Qwen Chat等。
实时语音翻译
Sokuji 是跨平台桌面应用,用 OpenAI、Google Gemini 等 API 提供实时语音翻译。支持多系统,有桌面版和浏览器插件,适配会议场景,还具备音频可视化、虚拟音频设备等特色功能。
WebAssembly 3.0 发布,64 位内存、垃圾回收全都有,先别激动,组件模型还没做完!
WebAssembly 3.0 发布,有 64 位内存、垃圾回收等特性,但备受期待的组件模型未完成。虽未迎来‘Docker 时刻’,但服务器端生态有进展,不少平台已实现‘类组件’能力。
让AI生成视频「又长又快」:Rolling Forcing实现分钟级实时生成
南洋理工大学与腾讯ARC实验室联合研究,由博士生刘坤昊等完成,提出Rolling Forcing方法,通过滚动窗口联合降噪等创新设计,突破实时长视频生成瓶颈,实现分钟级实时生成,还支持交互控制,但仍有优化方向。
大模型智能体不止能写代码,还能被训练成白帽黑客
Amazon AWS AI的Q Developer团队发布两项训练网络安全大模型的新方法Cyber - Zero和CTF - Dojo。前者不依赖真实环境生成训练数据,后者构建实战环境让模型学发现漏洞,二者结合为AI白帽黑客成长提供路径。
大模型“拼好题”,45K数据撬动18%提升,数学问题拒绝死记硬背 | MathFusion
上海AI Lab等团队提出MathFusion,通过三种“融合策略”生成新的融合数据集MathFusionQA,仅用45K合成指令,在多基准测试中平均准确率提升18.0个百分点,增强模型解决数学问题的能力。
ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键
ICML 2025新研究揭示,在使用RoPE的现代Transformer模型里,注意力机制Q和K表示有集中极大值,V表示无此模式。研究通过实验明确极大值与上下文知识理解的联系,对模型设计、优化和量化有重要启示。
一周1.2k星!兼具质量与效率的OCR模型MonkeyOCR,支持多样化的中英文PDF
MonkeyOCR采用SRR三元组范式,简化多工具流程、避免整页文档处理低效问题。与MinerU、端到端模型相比性能更优,处理速度也更快。暂不支持拍摄文档解析,文章还给出安装、推理等操作步骤。