Preference Optimization
Align a fine-tuned model with preference data using DPO, ORPO, KTO, or SimPO. Use when preference pairs or thumbs-up/down feedback exist, when choosing between preference-optimization methods, or when a DPO run needs hyperparameters or debugging.
wshobson/agentsv10 stars · 0 forks · 0 makes≈1.9K tokens
Scores by version
No eval runs reported yet. Incantory never runs prompts: owners report results from their own CI.
Datasets
No datasets.