scikit-learn ist eine quelloffene Python-Bibliothek für klassisches maschinelles Lernen, also für alle Verfahren jenseits tiefer neuronaler Netze. Enthalten sind Regressionen, Entscheidungsbäume, Random Forests, Support Vector Machines, Clusterverfahren und Methoden zur Dimensionsreduktion, dazu Werkzeuge für Datenaufbereitung, Aufteilung in Trainings- und Testdaten sowie Kennzahlen zur Bewertung.
Ihr Kennzeichen ist die einheitliche Bedienung, denn nahezu jedes Verfahren wird über dieselben wenigen Befehle trainiert und angewendet, sodass sich Modelle ohne Umbau vergleichen lassen. Sie setzt auf NumPy und SciPy auf und arbeitet auf dem Hauptprozessor, was für die typischen tabellarischen Datenmengen ausreicht.
Für die meisten betrieblichen Fragestellungen ist sie das passendere Werkzeug als Deep Learning: Bei strukturierten Daten aus Warenwirtschaft, CRM oder Buchhaltung liefern einfachere Verfahren oft ähnlich gute und dazu erklärbare Ergebnisse, und sie laufen auf gewöhnlicher Hardware in Sekunden.