Ghid operator pentru skill-ul MLOps
Ce face
mlops este skill-ul umbrelă pentru lucrul cu ciclul de viață al modelelor ML/AI: evaluare, training sau fine-tuning, serving, quantization, optimizare de inferență, experiment tracking și tooling asociat.
Este punctul de intrare pentru cereri despre Hugging Face Hub, vLLM, llama.cpp, Weights & Biases, lm-eval-harness, AudioCraft, Segment Anything Model și tehnici de abliteration / refusal removal. Nu înlocuiește documentația fiecărei unelte și nu garantează că infrastructura există deja. Alege sertarul corect, apoi cere probe. Altfel doar mângâi GPU-ul înainte să ia foc.
Vezi și All guides pentru restul capabilităților.
Când îmi folosește
Folosește mlops când cererea intră în una dintre zonele următoare:
- benchmarking sau evaluare standardizată de LLM-uri, inclusiv MMLU, GSM8K, HellaSwag, TruthfulQA sau HumanEval;
- comparații între modele, checkpoint-uri sau backend-uri de evaluare;
- operațiuni Hugging Face Hub: căutare, download, upload sau management de modele și dataset-uri;
- inferență locală cu modele GGUF prin llama.cpp;
- serving high-throughput cu vLLM, inclusiv API OpenAI-compatible, batch inference, tensor parallelism, deployment și metrici;
- quantization, tuning pentru throughput, TTFT, memorie sau cost operațional;
- experiment tracking, sweeps, dashboards și model registry cu Weights & Biases;
- generare audio locală cu AudioCraft, inclusiv MusicGen, AudioGen, EnCodec, melody conditioning sau demo-uri Gradio;
- segmentare zero-shot de imagini cu SAM, inclusiv point, box sau mask prompts, automatic masks, object extraction și export ONNX/browser;
- abliteration / refusal removal, doar în contexte autorizate, controlate și compatibile cu politica proiectului.
Nu folosi skill-ul pentru explicații generale de tip „ce este un model”. Folosește-l când există o operațiune, comparație, evaluare, configurare sau decizie tehnică de făcut.
Cum îl invoc / declanșez
Nu există o comandă publică universală garantată pentru toate runtime-urile. Declanșatorul corect este semantic: orice cerere despre model deployment, optimization, evaluation, Hugging Face operations, local inference, vLLM serving, experiment tracking, audio model workflows sau image segmentation trebuie rutată prin mlops.
Exemple de formulări:
- „Evaluează modelul X pe MMLU și GSM8K.”
- „Rulează un GGUF local cu llama.cpp.”
- „Setează un server vLLM pentru inferență high-throughput.”
- „Compară două checkpoint-uri cu lm-eval-harness.”
- „Configurează experiment tracking cu W&B.”
- „Folosește SAM pentru segmentare zero-shot.”
- „Generează audio local cu AudioCraft.”
După declanșare, skill-ul alege subzona relevantă: evaluare LLM, Hugging Face Hub, llama.cpp, vLLM, Weights & Biases, AudioCraft, SAM sau abliteration.
Exemplu practic
Scenariu: vrei să alegi între două modele pentru deployment.
Cerere posibilă:
„Compară modelul A și modelul B pe benchmark-uri standard și spune-mi care e mai potrivit pentru deployment.”
Fluxul corect:
mlopsclasifică cererea ca evaluare de LLM.- Pentru benchmark-uri standard, ruta principală este
lm-eval-harness. - Dacă modelele sunt găzduite pe Hugging Face, se folosesc operațiuni HF doar cât este necesar și doar cu acces autorizat.
- Dacă evaluarea trebuie făcută prin API, vLLM sau backend Hugging Face, se alege backend-ul compatibil cu mediul disponibil.
- Rezultatul trebuie să includă scoruri, condiții de rulare, costuri operaționale, limitări și implicații de serving. Un tabel fără concluzie este decor funerar, nu analiză.
Output / unde aterizează
Output-ul depinde de cerere. Pentru evaluări, rezultatul poate fi un set de scoruri, comparații între modele, interpretarea checkpoint-urilor sau o recomandare de deployment. Pentru serving, poate fi o configurație, un plan de rulare, un smoke test, metrici sau pași de troubleshooting. Pentru experiment tracking, poate fi o schemă de logging, un sweep sau o recomandare de registru de modele.
Skill-ul nu promite o destinație publică fixă pentru output. Nu presupune acces la servicii externe, GPU, VRAM, chei API, conturi Hugging Face, conturi W&B sau infrastructură de deployment. Dacă un pas cere autentificare, resurse costisitoare, publicare, upload, expunere de endpoint sau modificarea unui serviciu, operatorul trebuie să autorizeze explicit.
Limite / gotchas
mlops este umbrelă, nu dovadă că mașina poate face ce i-ai cerut. Înainte de rulări reale trebuie verificate mediul, dependențele, hardware-ul, memoria, accesul la modele, licențele, permisiunile și costurile. Nu se inventează rezultate de benchmark, output de training sau metrici când rularea nu a avut loc.
Pentru AudioCraft, preferă modele mai mici sau durate mai scurte pe VRAM limitat; pentru cereri din afara zonei potrivite, ia în calcul alternative precum Stable Audio, Bark sau Riffusion. Pentru SAM, folosește YOLO/Detectron2 pentru detecție real-time cu clase, GroundingDINO+SAM pentru măști promptate textual și SAM 2 pentru video segmentation.
Abliteration / refusal removal este sensibil: se folosește numai pe modele și date unde există drept de lucru, într-un scop legitim de cercetare, evaluare sau control intern. Nu transforma skill-ul într-o scurtătură pentru ocolirea politicilor sau publicarea nesupravegheată a unui model degradat.
Când apare tooling MLOps nou, regula este să extinzi umbrela mlops, nu să creezi skill-uri sibling aproape identice. Cimitirele de skill-uri nu sunt arhitectură. Sunt compost cu frontmatter.