from mlx_lm import load, generate model, tokenizer = load("mlx-community/Qwen2.5-7B-Instruct-4bit") prompt = tokenizer.apply_chat_template( [{"role": "user", "content": "What is the Second Noble Truth?"}], tokenize=False, add_generation_prompt=True, ) print(generate(model, tokenizer, prompt=prompt, max_tokens=200))