Ghid operator pentru skill-ul MLOps

Ce face

mlops este skill-ul umbrelă pentru lucrul cu ciclul de viață al modelelor ML/AI: evaluare, training sau fine-tuning, serving, quantization, optimizare de inferență, experiment tracking și tooling asociat.

Este punctul de intrare pentru cereri despre Hugging Face Hub, vLLM, llama.cpp, Weights & Biases, lm-eval-harness, AudioCraft, Segment Anything Model și tehnici de abliteration / refusal removal. Nu înlocuiește documentația fiecărei unelte și nu garantează că infrastructura există deja. Alege sertarul corect, apoi cere probe. Altfel doar mângâi GPU-ul înainte să ia foc.

Vezi și All guides pentru restul capabilităților.

Când îmi folosește

Folosește mlops când cererea intră în una dintre zonele următoare:

  • benchmarking sau evaluare standardizată de LLM-uri, inclusiv MMLU, GSM8K, HellaSwag, TruthfulQA sau HumanEval;
  • comparații între modele, checkpoint-uri sau backend-uri de evaluare;
  • operațiuni Hugging Face Hub: căutare, download, upload sau management de modele și dataset-uri;
  • inferență locală cu modele GGUF prin llama.cpp;
  • serving high-throughput cu vLLM, inclusiv API OpenAI-compatible, batch inference, tensor parallelism, deployment și metrici;
  • quantization, tuning pentru throughput, TTFT, memorie sau cost operațional;
  • experiment tracking, sweeps, dashboards și model registry cu Weights & Biases;
  • generare audio locală cu AudioCraft, inclusiv MusicGen, AudioGen, EnCodec, melody conditioning sau demo-uri Gradio;
  • segmentare zero-shot de imagini cu SAM, inclusiv point, box sau mask prompts, automatic masks, object extraction și export ONNX/browser;
  • abliteration / refusal removal, doar în contexte autorizate, controlate și compatibile cu politica proiectului.

Nu folosi skill-ul pentru explicații generale de tip „ce este un model”. Folosește-l când există o operațiune, comparație, evaluare, configurare sau decizie tehnică de făcut.

Cum îl invoc / declanșez

Nu există o comandă publică universală garantată pentru toate runtime-urile. Declanșatorul corect este semantic: orice cerere despre model deployment, optimization, evaluation, Hugging Face operations, local inference, vLLM serving, experiment tracking, audio model workflows sau image segmentation trebuie rutată prin mlops.

Exemple de formulări:

  • „Evaluează modelul X pe MMLU și GSM8K.”
  • „Rulează un GGUF local cu llama.cpp.”
  • „Setează un server vLLM pentru inferență high-throughput.”
  • „Compară două checkpoint-uri cu lm-eval-harness.”
  • „Configurează experiment tracking cu W&B.”
  • „Folosește SAM pentru segmentare zero-shot.”
  • „Generează audio local cu AudioCraft.”

După declanșare, skill-ul alege subzona relevantă: evaluare LLM, Hugging Face Hub, llama.cpp, vLLM, Weights & Biases, AudioCraft, SAM sau abliteration.

Exemplu practic

Scenariu: vrei să alegi între două modele pentru deployment.

Cerere posibilă:

„Compară modelul A și modelul B pe benchmark-uri standard și spune-mi care e mai potrivit pentru deployment.”

Fluxul corect:

  1. mlops clasifică cererea ca evaluare de LLM.
  2. Pentru benchmark-uri standard, ruta principală este lm-eval-harness.
  3. Dacă modelele sunt găzduite pe Hugging Face, se folosesc operațiuni HF doar cât este necesar și doar cu acces autorizat.
  4. Dacă evaluarea trebuie făcută prin API, vLLM sau backend Hugging Face, se alege backend-ul compatibil cu mediul disponibil.
  5. Rezultatul trebuie să includă scoruri, condiții de rulare, costuri operaționale, limitări și implicații de serving. Un tabel fără concluzie este decor funerar, nu analiză.

Output / unde aterizează

Output-ul depinde de cerere. Pentru evaluări, rezultatul poate fi un set de scoruri, comparații între modele, interpretarea checkpoint-urilor sau o recomandare de deployment. Pentru serving, poate fi o configurație, un plan de rulare, un smoke test, metrici sau pași de troubleshooting. Pentru experiment tracking, poate fi o schemă de logging, un sweep sau o recomandare de registru de modele.

Skill-ul nu promite o destinație publică fixă pentru output. Nu presupune acces la servicii externe, GPU, VRAM, chei API, conturi Hugging Face, conturi W&B sau infrastructură de deployment. Dacă un pas cere autentificare, resurse costisitoare, publicare, upload, expunere de endpoint sau modificarea unui serviciu, operatorul trebuie să autorizeze explicit.

Limite / gotchas

mlops este umbrelă, nu dovadă că mașina poate face ce i-ai cerut. Înainte de rulări reale trebuie verificate mediul, dependențele, hardware-ul, memoria, accesul la modele, licențele, permisiunile și costurile. Nu se inventează rezultate de benchmark, output de training sau metrici când rularea nu a avut loc.

Pentru AudioCraft, preferă modele mai mici sau durate mai scurte pe VRAM limitat; pentru cereri din afara zonei potrivite, ia în calcul alternative precum Stable Audio, Bark sau Riffusion. Pentru SAM, folosește YOLO/Detectron2 pentru detecție real-time cu clase, GroundingDINO+SAM pentru măști promptate textual și SAM 2 pentru video segmentation.

Abliteration / refusal removal este sensibil: se folosește numai pe modele și date unde există drept de lucru, într-un scop legitim de cercetare, evaluare sau control intern. Nu transforma skill-ul într-o scurtătură pentru ocolirea politicilor sau publicarea nesupravegheată a unui model degradat.

Când apare tooling MLOps nou, regula este să extinzi umbrela mlops, nu să creezi skill-uri sibling aproape identice. Cimitirele de skill-uri nu sunt arhitectură. Sunt compost cu frontmatter.