{
  "generated_at": "2026-07-23T21:45:51Z",
  "environment": {
    "environment_label": "Movey test GPU",
    "gpu": "NVIDIA GeForce RTX 3090",
    "vram_mib": 24576,
    "runtime": "Local Ollama generate API",
    "comfyui_models_freed_before_test": {
      "ok": true,
      "note": "ComfyUI returned HTTP success with an empty response body. GPU use fell to 1024 MiB before the benchmark."
    },
    "gpu_before": {
      "used_mib": 1024,
      "free_mib": 23112
    }
  },
  "method": {
    "prompt": "Classify this request into exactly one route: image, video, or director. Return one JSON object only. Request: Create a 30 second product story with three scenes and the same watch in every shot.",
    "temperature": 0,
    "seed": 42,
    "num_predict": 64,
    "stream": false,
    "thinking": false,
    "runs_per_model": 3,
    "note": "Single-host engineering measurements, not universal model benchmarks. Cold and warm latency depend on disk cache, model placement, runtime version, prompt caching, and concurrent GPU use."
  },
  "models": [
    {
      "name": "llama3.1:8b",
      "disk_size_gb": 4.9,
      "runs": [
        {
          "state": "cold",
          "response": "```json\n{\n    \"route\": \"video\"\n}\n```",
          "total_seconds": 2.0622,
          "load_seconds": 1.938,
          "prompt_tokens": 52,
          "output_tokens": 14,
          "tokens_per_second": 144.4,
          "gpu_after": {
            "used_mib": 6687,
            "free_mib": 17448
          }
        },
        {
          "state": "warm_1",
          "response": "```json\n{\n    \"route\": \"video\"\n}\n```",
          "total_seconds": 0.2328,
          "load_seconds": 0.1169,
          "prompt_tokens": 52,
          "output_tokens": 14,
          "tokens_per_second": 147.55,
          "gpu_after": {
            "used_mib": 6687,
            "free_mib": 17448
          }
        },
        {
          "state": "warm_2",
          "response": "```json\n{\n    \"route\": \"video\"\n}\n```",
          "total_seconds": 0.2258,
          "load_seconds": 0.1129,
          "prompt_tokens": 52,
          "output_tokens": 14,
          "tokens_per_second": 149.56,
          "gpu_after": {
            "used_mib": 6687,
            "free_mib": 17448
          }
        }
      ]
    },
    {
      "name": "qwen3:14b",
      "disk_size_gb": 9.3,
      "runs": [
        {
          "state": "cold",
          "response": "{\"route\": \"video\"}",
          "total_seconds": 1.7986,
          "load_seconds": 1.6381,
          "prompt_tokens": 59,
          "output_tokens": 7,
          "tokens_per_second": 87.4,
          "gpu_after": {
            "used_mib": 10633,
            "free_mib": 13502
          }
        },
        {
          "state": "warm_1",
          "response": "{\"route\": \"video\"}",
          "total_seconds": 0.198,
          "load_seconds": 0.1022,
          "prompt_tokens": 59,
          "output_tokens": 7,
          "tokens_per_second": 90.63,
          "gpu_after": {
            "used_mib": 10633,
            "free_mib": 13502
          }
        },
        {
          "state": "warm_2",
          "response": "{\"route\": \"video\"}",
          "total_seconds": 0.1831,
          "load_seconds": 0.0892,
          "prompt_tokens": 59,
          "output_tokens": 7,
          "tokens_per_second": 90.52,
          "gpu_after": {
            "used_mib": 10633,
            "free_mib": 13502
          }
        }
      ]
    }
  ]
}
