9 lines
326 B
Python
9 lines
326 B
Python
from mlx_lm import load, generate
|
|
|
|
model, tokenizer = load("mlx-community/Qwen2.5-7B-Instruct-4bit")
|
|
prompt = tokenizer.apply_chat_template(
|
|
[{"role": "user", "content": "What is the Second Noble Truth?"}],
|
|
tokenize=False, add_generation_prompt=True,
|
|
)
|
|
print(generate(model, tokenizer, prompt=prompt, max_tokens=200))
|