HackerRank Dataset-Erstellungsmethodik

Last updated: June 23, 2025

Dieses Dokument erklärt, wie HackerRank Datensätze im gesamten SDLC entwirft, erstellt und bereitstellt, um Kunden bei der Beschleunigung der Softwareentwicklung zu unterstützen. 

Das untenstehende Flussdiagramm veranschaulicht die HackerRank Dataset Creation Methodology.

Engagement Kickoff

Jede Zusammenarbeit beginnt mit einem Fokus auf das Verständnis Ihres Geschäftskontexts, Ihrer technischen Ziele, Datenanforderungen und Sicherheitsbeschränkungen. Dies stellt sicher, dass HackerRank vollständig ausgerichtet ist, bevor mit der Projektarbeit begonnen wird.

Ziel- und Umfangsausrichtung

Der erste Schritt besteht darin, den Anwendungsfall und die Erfolgskriterien für Ihr Modell zu verstehen. Dies stellt sicher, dass alle Lieferungen – von einzelnen Aufgaben bis hin zu Bewertungsdatensätzen – mit Ihrem Endziel übereinstimmen.

  • Anwendungsfalldefinition: HackerRank’s Machine Learning (ML) Wissenschaftler arbeiten mit Ihrem Team zusammen, um die spezifische Fähigkeit zu definieren, die Sie verbessern möchten, wie zum Beispiel:

    • Codegenerierung

    • Fehlererkennung oder Fehlerbehebung

    • Codezusammenfassung oder Erklärbarkeit

    • Code-Refactoring oder Optimierung

    • Testfallgenerierung

    • Sicheres Codieren oder Linting-Automatisierung

  • Modellkontext: Erfasst technische Details wie:

    • Modellarchitektur (zum Beispiel Encoder-Decoder, Decoder-Only, instruction-tuned)

    • Feinabstimmung oder Nachtraining-Methode (zum Beispiel vollständige Feinabstimmung, LoRA, SFT, RLHF, DPO)

    • Token-Budget, Latenz-Ziele und Kontextfenster-Beschränkungen

  • Erfolgsmessgrößen: Definieren Sie sowohl quantitative als auch qualitative Ziele, wie zum Beispiel:

    • BLEU, CodeBLEU, exakte Übereinstimmungsgenauigkeit oder Code-Korrektheit (Einheitstest-Fehlerquote)

    • Halluzinationen-Rate oder Reduktion der Fehlerquote

    • Latenz oder Inferenzkosten pro Token

Durch die Definition von Schlüsselkennzahlen (KPIs) und Modellverhaltenszielen richtet HackerRank die nachgelagerten Entscheidungen—wie Aufgabenwahl und Bewertungsformat—an Ihren Geschäftsprioritäten aus.

Zeitplan und Meilensteinplanung

Das Projekt ist in verschiedene Phasen unterteilt, um eine transparente und nachvollziehbare Durchführung zu gewährleisten.

  • Der Lieferzeitplan wird gemeinsam festgelegt und in klare Meilensteine unterteilt:

    • Abschluss der Dataset-Struktur

    • Aufgabenauswahl oder Pilotüberprüfung

    • Evaluationsaufbau und Baseline-Erstellung

    • Endgültige Dataset-Lieferung und Abnahme

  • Jede Phase beinhaltet Feedback-Checkpoints, um Transparenz zu gewährleisten.

  • Wöchentliche Abstimmungen und gemeinsame Projekt-Tracker sorgen für Verantwortlichkeit und Sichtbarkeit.

Sicherheit und Datenresidenz

HackerRank hält sich an branchenübliche Datenschutz- und Sicherheitspraktiken. Während des Projektstarts finalisiert HackerRank Ihre Sicherheits- und Compliance-Anforderungen.

  • Datenverarbeitung: Wenn die Zusammenarbeit proprietären Quellcode oder Modellartefakte umfasst, werden folgende Optionen unterstützt:

    • NDA-gestützte Zugriffskontrollen

    • Datenverarbeitung in der Region (zum Beispiel nur EU, nur Indien)

    • Keine Aufbewahrungsrichtlinien

    • Sichere Cloud-Übergabe (zum Beispiel Amazon S3 mit eingeschränkten Zugriffsschlüsseln)

  • PII-Redaktion: Bei der Arbeit mit Produktionsdaten (zum Beispiel Codeausschnitte aus Tickets oder Protokollen) werden benutzerdefinierte Pipelines für:

    • Personenbezogene Daten (PII) Redaktion (zum Beispiel Namen, E-Mails, Tokens, IP-Adressen)

    • Sensitives Muster-Masking (zum Beispiel API-Schlüssel, Datenbank-Zugangsdaten)

  • Tooling-Isolation: Alle Datensatz-Erstellungen erfolgen in isolierten Umgebungen mit Zugriffprotokollen, Versionskontrolle und Nachvollziehbarkeit.

Stakeholder-Onboarding

Stakeholder-Rollen sind zu Beginn jeder Zusammenarbeit klar definiert.

  • Ihre Organisation:

    • Technischer Ansprechpartner (zum Beispiel Modellbesitzer, ML-Ingenieur)

    • Geschäftsleiter (zum Beispiel Produktmanager, CTO)

    • Sicherheits- oder Compliance-Vertreter

  • Bei HackerRank:

    • Engagement-Manager

    • Fachbereichsleiter (SME)

    • Qualitätssicherungsleiter (QA)

    • ML-Wissenschaftler

HackerRank richtet gemeinsame Kommunikationskanäle (Slack oder E-Mail) und einen optionalen gemeinsamen Laufwerksordner für Echtzeit-Updates und Statusberichte ein.

Datensatzvorbereitung

HackerRanks Kernkompetenz liegt in einem globalen Netzwerk hochqualifizierter Fachexperten (SMEs) und einer bewährten Methodik zur Erstellung von produktionsreifen, vielfältigen Code-Datensätzen. Der Prozess integriert Fachwissen, strukturierte Arbeitsabläufe und mehrstufige Qualitätssicherung, um sicherzustellen, dass jeder Datenpunkt genau, erklärbar und auf Ihre Ziele ausgerichtet ist.

Von Experten kuratierte Inhaltserstellung

  • SME-Auswahl: Jede Dataset-Beteiligung beginnt mit der Auswahl eines dedizierten Panels von SMEs, die nachweisliche Fachkenntnisse in den Zielsprachen, Frameworks und Domänen besitzen (zum Beispiel Backend-Entwicklung, Datenengineering, DevOps).

  • Realistisches Aufgaben-Design: Jeder SME ist verantwortlich für die Gestaltung origineller Programmieraufgaben, die authentische Herausforderungen widerspiegeln, die in der Softwareentwicklung gesehen werden, wie die Implementierung einer REST-API, das Debuggen von Nebenläufigkeitsfehlern oder das Refactoring von Legacy-Code. Aufgaben sind auf die Ziele des Kunden abgestimmt (zum Beispiel Codegenerierung, Fehlerbehebung, Zusammenfassung) und variieren in Komplexität und Format (Funktionen, Klassen, Skripte, Projekte). Die SMEs verwenden interne Autorentools, die Echtzeit-Feedback zur Formatkonformität, Tagging und Vollständigkeit bieten. Dashboards, die die Leistung der Autoren und die Abdeckung des Datensatzes verfolgen, werden ebenfalls gepflegt.

  • Richtlinien für die Aufgaben-Erstellung: SMEs werden mit detaillierten, standardisierten Anweisungen für die Aufgaben-Erstellung geschult. Diese umfassen Regeln für:

    • Problemformulierung und Klarheit

    • Erwartete Eingaben/Ausgaben

    • Abdeckung von Randfällen

    • Testfalldesign

    • Metadatenanforderungen (zum Beispiel Laufzeitbeschränkungen, erwartete Leistung)

  • Aufgabenüberprüfung und -genehmigung: Jede Aufgabe durchläuft einen strukturierten Überprüfungsprozess, der von einem SME-Manager (einem leitenden Content-Ingenieur mit Domänenexpertise) geleitet wird, bevor sie in den Datensatz aufgenommen wird. Der Überprüfungsprozess umfasst Kontrollen auf technische Korrektheit, Klarheit der Anweisungen, Relevanz für die reale Welt und Einhaltung der Standards für die Erstellung.
    Ein internes Toolset rationalisiert den Überprüfungs- und Feedback-Prozess, um die Qualität und Verantwortlichkeit der Aufgaben sicherzustellen.

    • Zielgerichtetes Feedback: Der SME-Manager kann Zeilenkommentare direkt innerhalb der Aufgabe bereitstellen.

    • Überarbeitungsloop: Abgelehnte Aufgaben werden mit detailliertem Feedback und Verbesserungsvorschlägen an den Autor zurückgesendet. Der Autor überarbeitet die Aufgabe und reicht sie erneut zur Überprüfung ein.

    • Versionskontrolle: Alle Änderungen werden in einem versionskontrollierten System mit Prüfpfaden verfolgt.

    • Leistungsüberwachung: Pflegen Sie Dashboards, die die Leistung des Autors (zum Beispiel die für die Erstellung jeder Aufgabe benötigte Zeit) und die Abdeckung des Datensatzes verfolgen.

  • Akzeptanzkriterien: Eine Aufgabe wird nur genehmigt, wenn sie die Überprüfung ohne blockierende Probleme besteht. Strenge Qualitätskontrollen stellen sicher, dass:

    • Nur vollständig genehmigte Aufgaben in Produktionsdatensätzen enthalten sind

    • Teilweise akzeptierte oder „ausreichende“ Aufgaben ausgeschlossen sind
      Dieser strukturierte Überprüfungsprozess stellt sicher, dass jede Aufgabe verfeinert, eindeutig und für das Training oder die Bewertung großer Sprachmodelle (LLMs) geeignet ist.

  • Mehrere Lösungen pro Aufgabe: Um die Vielfalt und Robustheit Ihrer Trainingsdaten zu verbessern, wird jede Aufgabe unabhängig von mindestens drei verschiedenen SMEs gelöst. Dies bietet eine Reihe von Lösungsstilen und ermöglicht es Modellen, aus unterschiedlichen Denkansätzen zu lernen. Sie können auch die Anzahl der erforderlichen Lösungen pro Aufgabe basierend auf Ihren spezifischen Bedürfnissen konfigurieren.

Metadaten- und Kontextaufnahme

Jede Aufgaben- und Lösungskombination wird mit detaillierten Metadaten versehen, um die nachgelagerte Nutzung zu unterstützen, einschließlich:

  • Build- und Ausführungsanweisungen

  • Sprachversion und Abhängigkeitsliste

  • Analyse der Zeit- und Raumkomplexität (falls zutreffend)

  • Randfälle und erwartete Fehlermodi

  • Leistungsoptimierungsnotizen

Diese Metadaten gewährleisten Reproduzierbarkeit, einfache Filterung und bessere Kontrolle über Dataset-Slices (zum Beispiel nach Schwierigkeitsgrad, Länge oder Fehlerart).

Automatisierte und menschliche Qualitätssicherung

Ein zweischichtiger QA-Prozess wird angewendet, um hohe Einreichungsstandards aufrechtzuerhalten:

  • Sanity-Checks: Alle Einreichungen werden durch automatisierte Pipelines validiert, die Testfälle ausführen, Linting für Stil und Syntax durchführen und die Konsistenz zwischen jedem Problem und seiner Lösung überprüfen.

  • Peer-Review: Einreichungen werden von einem anderen SME peer-reviewed, um Korrektheit, Klarheit und Einhaltung der festgelegten Standards sicherzustellen. Meinungsverschiedenheiten lösen eine strukturierte Schlichtung vor der Finalisierung aus.

  • Stil- und Dokumentationsprüfungen: Neben der funktionalen Korrektheit folgt jede Lösung einem idiomatischen Codestil, enthält hilfreiche Kommentare und vermeidet Anti-Pattern. Diese Prüfungen sind wesentlich für die Feinabstimmung von Entwicklerassistenten und Code-Erklärungsmodellen.

2ndimage.png

Modelbewertung

Sobald der Datensatz finalisiert ist, tritt er in eine strukturierte Bewertungsphase ein, um zu beurteilen, wie gut das Modell nach der Feinabstimmung mit den neuen Daten funktioniert.

Feinabstimmung und erste Bewertung

  • Modelintegration: Das Foundation-Modell des Kunden oder das Foundation-Modell Ihrer Wahl wird mit dem kuratierten Datensatz feinabgestimmt. Dies umfasst:

    • Vollständige Feinabstimmung

    • Instruktionsabstimmung

    • Few-Shot-Prompt-Erstellung

    • Überwachtes oder RLHF-Training, je nach Kontext

  • Benchmarks: Die Modellleistung wird bewertet anhand von:

    • Standard-Benchmarks wie HumanEval, MBPP und CodeXGlue

    • HackerRanks ASTRA-Benchmark, angepasst an Ihren Anwendungsfall

    • Eigene Testsuiten, abgeleitet von Ihren Produktionsanwendungen

    • Bewertungsmetriken, die auf Ihre Ziele abgestimmt sind, wie BLEU, exakte Übereinstimmungsgenauigkeit, funktionale Korrektheit, Latenz und Halluzinationsraten

Wenn kein geeigneter öffentlicher Benchmark für eine Aufgabe existiert (z.B. domänenspezifische Sprache, Refactoring), wird HackerRank gemeinsam mit dem Kunden eine maßgeschneiderte Bewertungssuite entwickeln, um eine sinnvolle Bewertung sicherzustellen.

Bewertungsdesign (falls zutreffend)

Wenn Open-Source-Benchmarks den Anwendungsfall nicht ausreichend abdecken, wird eine maßgeschneiderte Bewertungssuite entwickelt. Dies umfasst:

  • Aufgabenpakete, die aus Ihrem bestehenden Codebasis kuratiert wurden

  • Manuell bewertete Gold-Labels von HackerRank-SME

  • Metriken, die auf Ihre Geschäftsziele zugeschnitten sind, wie Lesbarkeit, Sicherheit oder Testabdeckung

  • Randfälle und adversarielle Beispiele

  • Regression-sichere Teilmengen für zukünftige Iterationen

Leistungsfeedback-Schleife

Wenn das Modell die vordefinierten Erfolgskriterien nicht erfüllt, wird ein strukturierter Feedback-Prozess eingeleitet.

  1. Fehleranalyse: Qualitative und quantitative Analysen werden durchgeführt, einschließlich:

    • Clustering von Fehlerfällen nach Problemtyp

    • Verwirrungsmatrix bei Labels oder Ausgaben

    • Code-Korrektheitsanalyse (zum Beispiel Syntaxfehler versus Logikfehler)

    • Menschliche Überprüfung der Modellausgaben bei Bedarf

  2. Diagnose und Attribution: Bestimmen Sie die Ursachen von Leistungslücken, indem Sie bewerten, ob sie resultieren aus:

    • Unzureichender Abdeckung im Datensatz

    • Ambiguous Aufgabenanweisungen

    • Modellunteranpassung oder Überanpassung

    • Bewertungsmismatches

  3. Datensatz-Iteration: Identifizierte Probleme werden durch folgende Maßnahmen behoben:

    • Verfeinerung bestehender Aufgaben (zum Beispiel, unklare Probleme umschreiben)

    • Hinzufügen neuer Beispiele, um schwache Bereiche anzugehen

    • Diversifizierung von Lösungsstilen oder Testszenarien

Kontinuierliche Verbesserungsloop

Der Bewertungs- und Feinabstimmungsprozess ist iterativ:

  • Das Modell wird kontinuierlich mit aktualisierten Datensätzen feinabgestimmt.

  • Neue Modellausgaben werden anhand von Benchmarks neu bewertet und gegen frühere Versionen regressiv getestet.

  • Eine Dataset- oder Modellversion wird nur dann für den Einsatz genehmigt, wenn:

    • Die primären Zielmetriken erreicht werden

    • Keine Regressionen bei sekundären Metriken festgestellt werden

    • Der Kunde zustimmt

Das Ziel ist es, den Kreis zwischen Modellverhalten und Dataset-Design zu schließen, um sicherzustellen, dass die in die Daten investierte Zeit zu messbaren Verbesserungen in der Leistung in der realen Welt führt.

3rdimage.png

Qualitätsprüfung

Vor der Lieferung durchläuft jeder Datensatz eine strukturierte, mehrstufige Qualitätsprüfung, um sicherzustellen, dass jede Aufgabe und Lösung den Standards für Korrektheit, Klarheit und Konsistenz entspricht.

Endgültige menschliche Überprüfung

Jede Aufgabe und die zugehörigen Lösungen werden einer abschließenden manuellen Prüfung durch die leitenden SME-Reviewer unterzogen, die nicht an der Erstellung der Aufgabe beteiligt waren. Dieser unparteiische Kontrollpunkt garantiert die Integrität des Datensatzes.

Folgende Kriterien werden überprüft:

  • Geschäftslogik und technische Korrektheit: Stellt die Aufgabe eine realistische und bedeutungsvolle Programmierherausforderung dar? Beantworten alle Lösungen die gestellte Problemstellung korrekt?

  • Code-Stil und Formatierung: Sind die Lösungen idiomatisch, lesbar und entsprechen sie den sprachspezifischen Stilrichtlinien? Ist die Formatierung konsistent und lehrreich?

  • Klarheit und Vollständigkeit der Erklärungen:  Wenn der Datensatz Inline-Kommentare oder externe Erklärungen enthält, sind diese klar und genau, damit ein LLM daraus lernen kann?

  • Testabdeckung und Ausführungsverhalten: Werden Randfälle getestet? Validieren die Testfälle sowohl korrekte als auch inkorrekte Implementierungen? Werden Zeit- und Raumbegrenzungen eingehalten?

Bewertung anhand der Rubrik

Gutachter verwenden eine Bewertungsrubrik, die jede Aufgabe in Schlüsselbereiche unterteilt (zum Beispiel Klarheit, Korrektheit, Vollständigkeit und Format) mit festgelegten Bestehen-/Nichtbestehen-Kriterien und Anmerkungen der Gutachter. Dies sorgt für ein konsistentes und transparentes Bewertungssystem über alle Gutachter hinweg.

  • Objektive Bewertung stellt die Übereinstimmung mit den Kundenerwartungen sicher.

  • Anmerkungen der Gutachter werden pro Aufgabe dokumentiert, um Nachvollziehbarkeit und kontinuierliche Verbesserung zu gewährleisten.

Streitbeilegung und Schlichtung

Wenn mehrere Gutachter uneinig sind:

  • Ein strukturierter Schlichtungsprozess wird eingeleitet.

  • Jeder Gutachter präsentiert seine Bewertung und Begründung.

  • Der SME-Manager vermittelt, um einen Konsens zu erzielen.

  • Eine Aufgabe wird erst abgeschlossen, wenn alle Bedenken geklärt sind und das Ergebnis dokumentiert wurde. 

Dieser Prozess vermeidet subjektive Inkonsistenzen und stellt sicher, dass keine Aufgabe mit offenen Fragen fortgesetzt wird.

Versionskontrolle und Prüfpfad

Alle Aufgabenänderungen, Feedbackzyklen, Gutachterkommentare und Genehmigungen werden mit internen Tools verfolgt.

  • Änderungsprotokolle werden für jede Aufgabe geführt.

  • Alle Überprüfungen sind mit Zeitstempel versehen und zugeordnet.

  • Eine vollständige Revisionsgeschichte ist auf Anfrage verfügbar, um zu zeigen, wie und warum sich eine Aufgabe entwickelt hat.

Tools und Automatisierung

Während menschliche Prüfer den Prozess leiten, wird auch eine abschließende Automatisierungsrunde durchgeführt, um:

  • Testfälle und Laufzeitverhalten erneut zu validieren

  • Formatierungsabweichungen und Dateiintegritätsprobleme zu erkennen

Integritäts-Hashes (zum Beispiel SHA-256) zur Unterstützung der Reproduzierbarkeit zu überprüfen.

4thimage.png

Datensatzlieferung

Nachdem ein Datensatz alle Qualitätsprüfungen bestanden hat und die erforderlichen Genehmigungen erhalten hat, initiiert HackerRank einen sicheren und überprüfbaren Lieferprozess. Der Lieferworkflow ist auf Nachverfolgbarkeit, Reproduzierbarkeit und nahtlose Integration mit ML-Pipelines ausgelegt.

Verpackung und Abschluss

Vor der Lieferung werden alle Komponenten des Datensatzes verpackt, um sicherzustellen, dass er portabel, überprüfbar und eigenständig ist.

  • Unterzeichneter Inhalt

    • Alle Aufgaben, Lösungen und Metadaten sind durch den QA-Prozess genehmigt.

    • Beinhaltet anwendbare Testdateien, Build-Skripte und Laufzeitanweisungen, falls zutreffend.

    • Aufgaben-zu-SME-Zuordnung ist enthalten, falls erforderlich (bei Bedarf anonymisiert).

  • Versionierung und Integrität

    • Der Datensatz ist als strukturierter Archiv (z.B. .tar.gz, .zip) mit konsistenten Dateipfaden verpackt.

    • Integritäts-Hashes (z.B. SHA-256) sind für alle Dateien und das gesamte Archiv enthalten.

    • Git-basierte Diffs für Änderungsverfolgung zwischen Datensatzversionen.

  • Dokumentationspaket

    • README-Datei mit Datensatzstruktur und Nutzungshinweisen.

    • Daten-Schema- oder Annotationsformat-Definitionen sind enthalten.

    • Sicherheitsnotizen und Handhabungsanweisungen sind dokumentiert.

Lieferkanäle

HackerRank unterstützt mehrere sichere, unternehmenskonforme Lieferkanäle:

  • Verschlüsselter Cloud-Übergabekanal (z.B. AWS S3 Pre-Signed URL, GCS sicherer Bucket, Azure Blob-Link)

  • Vom Kunden festgelegte sichere FTP- oder VPN-Endpunkte

Alle Lieferungen werden protokolliert und sind nachvollziehbar.

Kundenführung

Auf Anfrage bietet HackerRank eine Führungssitzung mit Ihrem Team an, um:

  • Die Struktur des Datensatzes und die Evaluationssetup zu überprüfen

  • Metadaten, Beschriftungskonventionen oder erwartete Nutzungsmuster zu klären

  • Integrationsfragen von Data Scientists oder ML-Ingenieuren zu beantworten

  • Feedback für zukünftige Datensatz-Iterationen zu sammeln

Archivierung und Aufbewahrung

Sobald die Lieferung bestätigt ist:

  • HackerRank behält eine Kopie des Datensatzes und der Lieferprotokolle für 30 bis 90 Tage (konfigurierbar).

  • Nach Ablauf des Aufbewahrungszeitraums wird der Datensatz sicher gelöscht, sofern nicht anders vereinbart.

  • Ein formeller Abschlussbericht der Lieferung wird ausgestellt, einschließlich:

    • Zeitstempel der Lieferung

    • Integritätsüberprüfungsprotokoll

    • Zusammenfassung der QA-Abdeckung