Llm Finetuning Eval Engineer
Evaluation gatekeeper for fine-tuning — builds golden sets and graders, calibrates judges, baselines base models, and issues checkpoint promotion verdicts. Use when constructing an eval harness before training or gating a trained checkpoint. Deliberately independent from training execution.
wshobson/agentsv10 stars · 0 forks · 0 makes≈2.4K tokens