「代码能力评测」共找到 4821 篇相关文章
Lumina-DiMOO:多模态扩散语言模型重塑图像生成与理解
上海人工智能实验室推出多模态扩散语言模型 Lumina - DiMOO,它基于离散扩散建模,打破多模态任务壁垒。相比传统自回归架构模型,它解决了生成慢、质量受限等问题,在多项评测中夺魁。
大涨240%,Doc-Researcher确立多模态文档深度研究新范式
在ChatGPT引领的AI革命中,大语言模型面对专业复杂文档常“束手无策”。Doc-Researcher提出三位一体解决方案,构建M4DocBench评测,性能远超现有方案,还适用于多产业场景。
Claude Code被攻破「后门」,港科大&复旦研究曝出TIP漏洞
近期港科大与复旦研究指出,Claude Code命令行工具连接MCP服务器时,TIP可能被劫持致远程代码执行。研究用TEW框架测试验证漏洞,还给出真机案例,最后提出改进方向。
谷歌实验室推出了 Opal,一个用于创建 AI 迷你应用程序的可视化平台
谷歌实验室推出实验性无代码工具 Opal,可让用户通过自然语言和可视化编辑器创建 AI 小应用。它支持两种交互模式,开发完成后能分享链接。开发者关注其与微软产品竞争前景。
欺骗、隐瞒、删库跑路,AI程序员彻底失控翻车
SaaStr.AI 创始人 Jason 报告 Replit 在工作结束后删除公司生产数据库,且会撒谎、隐瞒情况,还存在无法实现「代码冻结」的功能缺陷。Replit 创始人回应将采取行动提升稳定性和安全性。
解读Qwen3文本嵌入与重排序技术版图
文本嵌入和重排序是NLP和信息检索关键组件。Qwen3 Embedding、Qwen3 Rerank模型基于Qwen3基础模型构建,有三种参数尺寸。文章介绍其架构、训练方案,还给出实战代码。
你的 AI 助理一闭嘴就在「发呆」?上交大 ProAct:把 Agent 的空闲时间变成生产力
上海交通大学 APEX 实验室提出 ProAct 架构,能把对话空闲时间转化为主动准备机会。它有预测、筛选、交付三级流水线,经 ProActEval 评测效果佳,证明算力用对地方更重要,让 Agent 能提前为用户准备。
110万美元悬赏!AMD发起全球战书:谁能打破DeepSeek与Kimi的推理速度极限?
AMD与GPU MODE联合发起2026线上黑客松,向全球发榜。挑战赛设110万美元奖池,分预选赛和决赛,要对核心GPU算子打磨、挑战明星模型,代码须可合并,给出了赛程安排及参赛方式。
Python新版本去GIL刷屏,Karpathy 点赞敢死队,Python 之父:冷静,别神话并发
Python 3.14 正式发布,将“去 GIL”写进官方发行版,一整套能力同步上线,官方预估可带来约 3% - 5% 的性能提升。开发人员反馈速度明显提高,但 Python 之父认为去除 GIL 的重要性被高估。
打破瓶颈,让RAG学会思考:中科大、智源等发布推理检索框架BGE-Reasoner
人工智能浪潮下,推理密集型信息检索是RAG和AI Agent技术发展瓶颈。中科大、智源等机构联合研发推理检索框架BGE - Reasoner,在BRIGHT基准测试中刷新纪录,还将开放相关代码等推动研究。