diff --git a/scripts/collect_responses.py b/scripts/collect_responses.py index 9d22b45..26f7eb6 100644 --- a/scripts/collect_responses.py +++ b/scripts/collect_responses.py @@ -61,7 +61,7 @@ def run_frontier_pass(items: list[dict], out: Path, model: str = KIMI_MODEL, max # at 1000 tokens, harder prompts exhausted the budget mid-reasoning and # returned empty content (finish_reason="length", content=None). 3000 # leaves enough room for reasoning + a full visible answer. - text, usage = chat(client, model, [{"role": "user", "content": it["prompt"]}], max_tokens=3000) + text, usage = chat(client, model, [{"role": "user", "content": it["prompt"]}], max_tokens=8000) if not text or not text.strip(): raise ValueError("empty response content (likely reasoning-token budget exhaustion)") except Exception as e: