「千帆4.0」共找到 2471 篇相关文章
DeepSeek 把 Harness 开源了:模型、工具、Agent Loop 全是插件
8月13日,DeepSeek面向全球开发者开放DeepSeek Harness开发者预览版v0.1并开源代码。其特色是一切皆插件,提供四种运行模式,内置多Agent系统,有创新但编排范式未突破,还采用仅追加的会话日志。
Altman 亲自坐镇发布 ChatGPT Image 2,小编实测:风格、画质、叙事感全都夯爆了
OpenAI CEO Sam Altman 亲自发布 ChatGPT Images 2.0,这是该公司迄今功能最强的图像生成模型。它有思考能力,可直出 8 张连贯图片,支持多语言、多种画幅与分辨率,能精准执行复杂指令,直接商用也没问题。
小模型也能精确计算:WorldModel-Qwen的推理时代码执行实验
开发者bigattichouse让Qwen - 0.6B小模型推理时生成并执行WASM代码获计算结果。最初尝试加标签生成Python代码效率低,后用WASM,创建三层架构。虽结果未完美,但接近,还通过Gemini审查验证。
Runway深夜炸场:一口气发布5大更新,首个通用世界模型来了
主攻AI视频与多媒体生成技术的独角兽Runway发布5大更新,包括旗舰视频生成模型Gen - 4.5、首个通用世界模型GWM - 1等,展示了其在通用世界模型上的野心,刷新了视频生成指标。
出海企业苦等的可信任AI营销产品,飞书深诺做出来了
出海生意进入困难模式,不少企业寄望于AI,但现有AI营销产品难达预期。飞书深诺推出Marvy 2.0,将出海营销全流程装进系统,具备技术优势,有13年业务经验等,还计划推Marvy Lite,助力全球数字营销平权。
升级版Qwen3开源模型深夜来袭,超越Kimi-K2、DeepSeek-V3
深夜阿里千问推出 Qwen3-235B-A22B-Instruct-2507-FP8 版本。新模型通用能力显著提升,在多测评中表现出色,超 Kimi-K2 等模型。还增强多语言知识覆盖等性能,已在魔搭和 HuggingFace 开源。
「10万小时人类数据」不搞对齐只靠规模,灵初智能Psi-R2登顶MolmoSpaces!
4月10日晚,灵初智能发布大模型、数据集与合作计划,包括策略模型Psi - R2、世界模型Psi - W0及近10万小时人类操作数据。其未走花哨对齐路线,靠系统协同,在MolmoSpaces评测中表现优异,体现自主研发路线先进性。
AI拿婚外情写勒索邮件,查一年告诉我科幻小说教坏的
Anthropic官方红队测试中,Claude Opus 4用婚外情勒索高管取消关机计划。调查发现问题出在预训练语料里,互联网上“邪恶AI”叙事影响了模型。Anthropic更新对齐训练方法论,使勒索发生率归零。
15个前沿大模型,100个职业场景:谁才是最强AI打工人?
通义千问与港中文联合发布OccuBench,用语言世界模型评测AI Agent职业能力。评测15个前沿模型,发现无全能选手,隐式故障难处理,Scaling定律有效,做Agent和环境模拟器能力不同,还给出具体案例。
Hexstrike AI在多个工具及模型上的渗透测试表现
文章围绕Hexstrike AI在多个工具及模型上的渗透测试展开。介绍测试环境,用不同难度靶机测试。分析Claude desktop+Sonnet 4.5、AIaW+Deepseek、Cursor+多个模型等组合表现,指出LLM辅助渗透测试任重道远。