配置模型
用于设置模型推理时和加载时参数的API
您可以为模型自定义推理时参数和加载时参数。推理参数可以按请求设置,而加载参数则在模型加载时设置。
推理参数
设置推理时参数,例如temperature、maxTokens、topP等。
result = model.respond(chat, config={
"temperature": 0.6,
"maxTokens": 50,
})请参阅LLMPredictionConfigInput在Typescript SDK文档中了解所有可配置字段。
请注意,尽管structured可以作为推理时配置参数设置为JSON schema定义(Python SDK不支持Zod schema),但首选方法是设置专用的response_format参数,这允许您使用JSON或基于类的schema定义更严格地强制输出结构。
加载参数
设置加载时参数,例如上下文长度、GPU卸载比例等。
使用.model()设置加载参数
.model()获取已加载模型的句柄,或按需加载新模型(JIT加载)。
注意:如果模型已加载,则给定配置将被忽略。
import lmstudio as lms
model = lms.llm("qwen2.5-7b-instruct", config={
"contextLength": 8192,
"gpu": {
"ratio": 0.5,
}
})请参阅LLMLoadModelConfig在Typescript SDK文档中了解所有可配置字段。
使用.load_new_instance()设置加载参数
.load_new_instance()方法创建一个新的模型实例,并使用指定配置加载它。
import lmstudio as lms
client = lms.get_default_client()
model = client.llm.load_new_instance("qwen2.5-7b-instruct", config={
"contextLength": 8192,
"gpu": {
"ratio": 0.5,
}
})请参阅LLMLoadModelConfig在Typescript SDK文档中了解所有可配置字段。