Qwen3 235B A22B 2507
Qwen3-235B-A22B 的更新版本,在通用能力方面有显著提升,包括指令遵循、逻辑推理、文本理解、数学、科学、编程和工具使用。
此 MoE 模型在总共 128 个专家中使用了 22B 个激活参数,每次有 8 个专家处于激活状态。与原始 Qwen3-235B-A22B 相比,它在多语言的长尾知识覆盖方面有了大幅提升,并且在主观和开放式任务中与用户偏好的对齐效果明显更好。
原生支持高达 262,144 个 token 的上下文长度,并增强了 256k 长上下文理解能力。
先进的智能体(Agent)能力,支持超过 100 种语言和方言。
注意:此模型仅支持非思考模式,不在输出中生成 <think></think> 块。