AI-Entwickler einstellen: Skills und Auswahlkriterien

Nahezu jeder Entwickler, den Sie 2026 interviewen, kann ein Sprachmodell prompten. Deutlich weniger haben ein AI-Feature ausgeliefert, das echten Produktionsverkehr, ein Security-Review und ein Quartal mit nachlassender Ausgabequalität überstanden hat. In dieser Lücke verschwinden die AI-Budgets des ersten Jahres.

Dieser Leitfaden zum Einstellen von AI-Entwicklern beginnt mit einer Regel: Entscheiden Sie zuerst, ob die Aufgabe Modellentwicklung, Anwendungsentwicklung oder Evaluierung ist, und prüfen Sie Kandidaten dann an Systemen, die sie vor echte Nutzer gestellt haben, nicht an Modellen, die sie in einem Notebook feinjustiert haben. Klarheit über die Rolle, mehr als Seniorität, ist das, was die meisten gescheiterten AI-Einstellungen falsch gemacht haben.

Im Folgenden geht es um Rollentypen, Prüffragen, Modelle der Zusammenarbeit und Kostentreiber. Die Grundlage ist ein Team, das produktionsreife AI-Agenten mit echtem Gedächtnis, Eskalationsregeln und vollständigen Audit-Logs ausliefert und Modelle auf Kundendaten statt auf Benchmark-Sets trainiert. Jede Einschätzung unten ist eine, die wir beim Scoping von Services für AI-Entwicklung treffen, wo sich der Abstand zwischen einem überzeugenden CV und einem funktionierenden System meist schon im ersten Sprint zeigt.

Welche Art von AI-Entwickler brauchen Sie wirklich?

Die meisten gescheiterten AI-Einstellungen beginnen mit einer Stellenbezeichnung statt mit einer Problembeschreibung. “AI-Entwickler” umfasst drei Disziplinen, die sich das Vokabular teilen und ansonsten wenig gemeinsam haben. Der erste Schritt in jedem Leitfaden zum Einstellen von AI-Entwicklern ist deshalb die Entscheidung, welche davon Ihre Roadmap braucht. Wählen Sie falsch, zahlen Sie Forschungsgehälter für jemanden, dessen eigentliche Aufgabe darin besteht, eine Modell-API an die Abrechnung anzubinden.

Die AI-Rolle passend zum Ergebnis
Was Sie bauen
Rolle, die dafür verantwortlich ist
Zentrales Ergebnis
Signal im Tech-Stack
Was Sie bauen

Ein Modell, das auf Ihren eigenen Daten trainiert ist

Rolle, die dafür verantwortlich ist

ML Engineer

Zentrales Ergebnis

Trainingspipeline, Evaluierungsrahmen, Plan für das Neutraining

Signal im Tech-Stack

Python, Azure ML Studio, Feature Stores

Was Sie bauen

Ein Agent innerhalb Ihres Produkts

Rolle, die dafür verantwortlich ist

AI Application Engineer

Zentrales Ergebnis

Orchestrierung, Tool-Calls, Gedächtnis, Eskalation, Audit-Logs

Signal im Tech-Stack

LangChain, LangGraph, CrewAI, Ihr Backend-Stack

Was Sie bauen

Bessere Ergebnisse aus einem Drittanbietermodell

Rolle, die dafür verantwortlich ist

LLM- und Evaluierungsspezialist

Zentrales Ergebnis

Prompt-Suites, Evaluierungsdatensätze, Regressionstests für Ausgaben

Signal im Tech-Stack

Evaluierungs-Tooling, strukturierte Ausgabeschemata

Was Sie bauen

Alle drei gleichzeitig, mit Termindruck

Rolle, die dafür verantwortlich ist

Ein besetztes Team, nicht eine einzelne Person

Zentrales Ergebnis

Ein Lieferplan mit einer benannten verantwortlichen Person pro Ebene

Signal im Tech-Stack

Benannte Spezialisten, kein einzelner Generalist

ML Engineers: Modelltraining, Datenpipelines, Evaluierung

ML Engineers verdienen ihr Gehalt mit den Teilen, die niemand vorführt: Labeling-Strategie, Feature Engineering, Klassenungleichgewicht und der Evaluierungsrahmen, der Ihnen zeigt, dass ein Neutraining die Ergebnisse verschlechtert hat. Das Modell ist das kleinste Artefakt, das sie produzieren.

Es ist außerdem die datenabhängigste Einstellung, die Sie vornehmen werden. Bei Redwerks ML-Arbeit an einer Recruiting-Plattform, wo wir mit Azure ML Studio ein Modell zum Abgleich von Lebensläufen auf mehr als 1,5 Millionen Datensätzen trainiert haben, ging mehr Kalenderzeit in die Form der Daten als in die Modellauswahl. Ein Kandidat, der nur über Architekturen spricht, hat noch nie einen so unordentlichen Trainingsdatensatz verantwortet. Stellen Sie hier ein, wenn Ihr Vorteil in Daten liegt, die Ihnen gehören.

AI Application Engineers: Agenten, Orchestrierung, Integrationen

Das ist die Rolle, die die meisten Mid-Market-Teams brauchen und am häufigsten falsch bezeichnen. Ein AI Application Engineer baut das System um das Modell herum: was der Agent tun darf, was er an einen Menschen zurückgibt, was er sich merkt, was er protokolliert. Im Tagesgeschäft:

  • Tool- und Function-Calls gegen Ihre APIs, mit Retries und Timeouts, die davon ausgehen, dass das Modell manchmal falsch liegt.
  • Gedächtnis, das begrenzt und ablaufbar ist statt ein ständig wachsender Kontext-Blob.
  • Eskalationsregeln, damit ein unsicherer Agent stoppt statt zu improvisieren.
  • Instrumentierung auf jedem Schritt, denn “die AI hat etwas Seltsames gemacht” ist kein Fehlerbericht, mit dem man arbeiten kann.
  • Kosten und Latenz innerhalb eines Budgets, das das Produkt bei voller Last tragen kann.

Diese Liste kommt der Arbeitsdefinition von Redwerks Services für die Entwicklung von AI-Agenten sehr nahe. Entwickler, die darin gut sind, kommen aus der Backend-Arbeit und haben sich Orchestrierung angeeignet.

LLM- und Prompt-Spezialisten: wo sie hineinpassen

Prompt Engineering als eigenständige Vollzeitrolle ist unterhalb der Enterprise-Größe selten, und es zu Ihrer ersten AI-Einstellung zu machen, ist meist ein Fehler. Die unterschätzte Hälfte dieses Skillsets ist die Evaluierung: ein Testdatensatz aus echtem Traffic, eine Definition der richtigen Antwort in Ihrer Domäne und eine Regression, die auffällt, bevor ein Kunde sie findet.

In den meisten Mid-Market-Unternehmen liegt das beim Application Engineer oder bei einem QA-Spezialisten. Fragen Sie trotzdem ausdrücklich danach, denn Teams, die die Evaluierung überspringen, liefern AI-Features aus, deren Funktionieren sie nicht belegen können.

Prüffragen, die echte AI-Praxiserfahrung offenlegen

AI-Erfahrung lässt sich unerwartet leicht vortäuschen, weil das Vokabular öffentlich und die Tutorials ausgezeichnet sind. Die praktische Antwort auf die Frage, wie man einen AI-Entwickler einstellt, lautet: Fragen Sie nach Narben. Wer ein AI-System im Produktivbetrieb geführt hat, hat einen Vorrat sehr konkreter, leicht genervter Geschichten, und genau die sind das Signal. Arbeiten Sie die drei folgenden Gruppen in dieser Reihenfolge durch, denn Produktionserfahrung filtert bereits für die anderen zwei.

Produktionsreife

Beginnen Sie hier und werden Sie deutlich. Sie klären genau eine Sache: ob diese Person schon einmal Bereitschaft hatte für etwas, das ein Modell getan hat.

  • Welches Volumen an echtem Traffic hat Ihr AI-Feature bewegt, und was ist zuerst ausgefallen?
  • Woran haben Sie gemerkt, dass die Ausgabequalität gesunken ist? Erklären Sie mir den Alert.
  • Zeigen Sie mir, wie Sie die Entscheidung eines Agenten protokolliert haben, und wer sie lesen konnte.
  • Was haben Sie ausgeliefert und später abgeschaltet, und warum?

Die letzte Frage zählt am meisten, denn Kandidaten, die nur Demos gebaut haben, mussten nie eine abschalten. In der AI-gestützten Entwicklung individueller Software nennen Kunden den Audit-Trail und den Eskalationspfad zuerst Overhead, und genau die machen das System belastbar.

Framework-Tiefe im echten Einsatz

Framework-Namen im Lebenslauf sagen fast nichts. Was die Entscheidung gekostet hat, sagt viel. Fragen Sie, welches Orchestrierungs-Framework sie gewählt haben, und dann, was es schwierig gemacht hat.

Gute Antworten sind konkret und leicht kritisch. Wer wirklich auf LangChain ausgeliefert hat, kann die Teile benennen, die am Ende wieder herausgerissen wurden. Das ist dieselbe Unterscheidung, die sich zeigte, als wir die führenden LLM-Frameworks an echten Workloads statt an Demos gemessen haben. Gehen Sie als Nächstes auf den State ein: Fragen Sie, ob ein expliziter Graph oder eine rollenbasierte Crew gewählt wurde und was das zur Laufzeit gekostet hat. Genau dort hört LangGraph vs CrewAI auf, Geschmacksfrage zu sein, und wird zur operativen Randbedingung. Wenn zwischen beiden migriert wurde, fragen Sie, was kaputtgegangen ist: Der Schritt von einer linearen Chain zu einem zustandsbehafteten Graphen ist der Moment, in dem Teams entdecken, dass ihre Retry-Logik nie etwas getan hat. Das haben wir bei der Arbeit an LangChain vs LangGraph ebenfalls festgestellt.

Schließen Sie mit der billigsten Prüfung der Liste ab. Fragen Sie, was sie ganz ohne Framework bauen würden: echte Tiefe zeigt sich als zwei Sätze über die Schleife und die Zustandsverwaltung darunter, und das trennt diejenigen, die die Abstraktion verstehen, von denen, die von ihr abhängen.

Datensicherheit bei eigenen Datenbeständen

Wenn Ihr Projekt Kundendaten, Verträge, Gesundheitsdaten oder irgendetwas berührt, wonach ein Prüfer fragen wird, entscheidet dieser Punkt über die Einstellung. Hier haben Kandidaten am häufigsten eine selbstbewusste Antwort und keine Narben.

Fragen Sie, welche Daten ihre Umgebung verlassen haben, wie sie mit personenbezogenen Daten in Prompts umgegangen sind, welche Aufbewahrungsbedingungen sie mit ihrem Modellanbieter hatten und wer das abgezeichnet hat. Namen von Kontrollen zählen weniger als die Frage, ob der Kandidat dieses Gespräch mit einem Security-Team geführt und einen Teil davon verloren hat. Für regulierte Arbeit erwarten Sie ein privates Deployment und einen Nachweis darüber, welche Modellversion welche Daten gesehen hat.

Intern, Freelancer oder dediziertes AI-Team?

Sobald Sie wissen, welche Rolle Sie brauchen, ist die zweite Entscheidung, wie Sie sie besetzen, und das hängt davon ab, wie lange die Arbeit dauert und wie viele Disziplinen sie berührt. Die grobe Regel: ein klar abgegrenztes Ergebnis passt zu einem Freelancer, eine dauerhafte Fähigkeit zu einer Festanstellung, und ein Vorhaben über mehrere Disziplinen mit festem Termin zu einem Team.

Wie jedes Modell mit den AI-spezifischen Risiken umgeht
Das AI-Risiko
Freelancer
Interne Einstellung
Dediziertes AI-Team
Das AI-Risiko

Wer die Modellevaluierung verantwortet

Freelancer

Niemand, der Vertrag endet mit der Lieferung

Interne Einstellung

Derselbe Entwickler, der das Feature gebaut hat

Dediziertes AI-Team

Eine benannte verantwortliche Person für die Evaluierung, getrennt von der Entwicklung

Das AI-Risiko

Wenn die Ausgabequalität abdriftet

Freelancer

Nach der Lieferung außerhalb des Umfangs

Interne Einstellung

Ihre einzige AI-Einstellung hat die Bereitschaft allein

Dediziertes AI-Team

Ein Bereitschaftsplan über das gesamte Team

Das AI-Risiko

Zugriff auf geschützte Daten

Freelancer

Am schwersten freizugeben, ein Externer braucht eine Sicherheitsausnahme

Interne Einstellung

Am einfachsten, Mitarbeitende sind bereits innerhalb Ihres Sicherheitsperimeters

Dediziertes AI-Team

Vertraglich gewährt, mit NDA und Audit-Logging

Das AI-Risiko

Gleichzeitig abgedeckte Disziplinen

Freelancer

Eine, die im Vertrag genannte, meist AI-Anwendungsentwicklung

Interne Einstellung

Eine, die in der Stellenbeschreibung genannte

Dediziertes AI-Team

Drei: ML Engineering, AI-Anwendungsentwicklung und LLM-Evaluierung

Das AI-Risiko

Scheitert, wenn

Freelancer

Das Feature weiterlaufen muss, nachdem die Rechnung bezahlt ist

Interne Einstellung

Die Roadmap gleichzeitig Modelltraining, Anwendungsentwicklung und Evaluierung braucht

Dediziertes AI-Team

Intern niemand befugt ist, schnell zu entscheiden

Wann ein Freelancer ausreicht

Ein Freelancer ist richtig, wenn das Ergebnis klar abgegrenzt ist und jemand auf Ihrer Seite es danach übernehmen kann. Denken Sie an einen Proof of Concept, einen Evaluierungsrahmen oder eine Migration zwischen Modellanbietern.

Der Fehlermodus ist vorhersehbar. Freelance-AI-Arbeit kommt als funktionierendes Notebook mit einer dünnen Naht in Ihr Produkt, und die einzige Person, die diese Naht versteht, stellt ihre letzte Stunde in Rechnung und geht. Wenn das im nächsten Quartal unbeaufsichtigt laufen muss, haben Sie ein Wartungsproblem zum Sonderpreis.

Wann eine interne Einstellung sinnvoll ist

Stellen Sie intern ein, wenn AI aufhört, ein Projekt zu sein, und Teil des Produkts wird. Eine feste Mitarbeiterin oder ein fester Mitarbeiter sammelt den Kontext, der Ihr zweites und drittes AI-Feature billiger macht als das erste: die Eigenheiten Ihrer Daten, Ihre Toleranz für eine falsche Antwort, Ihren Review-Prozess.

Der Haken ist, dass die Stellenbeschreibung, die Sie heute schreiben, meist falsch ist. Teams suchen einen generalistischen AI Engineer, interviewen gegen ein Forschungs-Skillset und sehen dann zu, wie diese Einstellung drei Quartale mit Backend-Integration verbringt, die niemand eingeplant hatte. Schreiben Sie die Beschreibung stattdessen entlang des Ergebnisses, und halten Sie die Roadmap in Bewegung, während die Suche läuft. Unsere Delivery-Entwickler nutzen Tooling für die AI-gestützte Softwareentwicklung, darunter Codex, CodeWhisperer und AutoML, was erhöht, was das bestehende Team aufnehmen kann, ohne den Spezialisten ersetzen zu wollen.

Wann ein dediziertes AI-Team gewinnt

Ein dediziertes Team gewinnt, wenn das Vorhaben mehrere Disziplinen gleichzeitig und einen Termin braucht. Ein AI-Entwicklungsteam gibt Ihnen einen ML Engineer, einen Application Engineer und eine verantwortliche Person für die Evaluierung, ohne dass Sie drei Recruiting-Prozesse parallel führen müssen.

Das schärfere Argument ist die Abdeckung der Evaluierung. Wie erfahren eine Einzelbesetzung auch ist, sie korrigiert am Ende ihre eigenen Hausaufgaben: Wer die Prompt-Kette geschrieben hat, entscheidet auch, ob deren Ausgabe gut genug ist. Diese zwei Aufgaben auf verschiedene Personen zu verteilen, ist der strukturelle Grund, ein dediziertes Entwicklungsteam einzukaufen, statt hastig AI Engineers in einen Personalplan einzustellen, der geschrieben wurde, bevor jemand die Roadmap kannte. Es scheitert trotzdem, wenn intern nicht eine Person schnell entscheiden kann.

Entscheidungsbaum, der das Ergebnis eines AI-Projekts einem ML Engineer, einem AI Application Engineer oder einem Evaluierungsspezialisten zuordnet, samt passendem Modell der Zusammenarbeit

Was kostet es, AI-Entwickler einzustellen?

Es gibt keine einzige Zahl, und wer eine nennt, ohne Ihre Anforderungen gesehen zu haben, verkauft etwas. Orientieren Sie sich an öffentlichen Arbeitsmarktdaten plus Ihren eigenen Kostentreibern.

Für eine US-Basislinie nennt das BLS Occupational Outlook Handbook für Data Scientists, die am nächsten erfasste Berufsgruppe zur praktischen ML-Arbeit, einen Medianverdienst von 120.230 US-Dollar pro Jahr (Stand Mai 2025) und prognostiziert ein Wachstum des Feldes von 35 Prozent zwischen 2025 und 2035. Die Zahlen desselben Handbuchs für Mai 2025 zu Computer and Information Research Scientists setzen das Forschungsende bei einem Median von 140.300 US-Dollar an. Diese zwei Spannen sind der Grund, warum jede Kostenschätzung für AI-Entwickler, die auf Gehaltsdaten von 2023 beruht, heute zu niedrig aussieht.

Was Gehaltstabellen übersehen, ist der Teil, der für AI-Arbeit spezifisch ist: Personal ist oft überhaupt nicht die größte Position. In modelllastigen Projekten kosten Compute und Datenvorbereitung regelmäßig mehr als der Entwickler, der sie betreibt, und das Verhältnis verschiebt sich nach dem Launch noch einmal, wenn Inferenz zur laufenden Rechnung statt zu Aufbaukosten wird.

Die eigentlichen Kostentreiber

  • Modellarbeit gegenüber Anwendungsarbeit. Training auf Ihren eigenen Daten zieht Labeling, Compute und eine wiederkehrende Evaluierungsschleife nach sich. Ein gehostetes Modell verlagert die Ausgaben auf Inferenz pro Aufruf, die mit der Nutzung wächst.
  • Datenvolumen und Datenzustand. Volumen ist ein Compute-Kostenfaktor. Zustand ist ein Personalkostenfaktor und der, der Budgets überrascht: inkonsistente Schemata, fehlende Labels, Duplikate.
  • Compliance und Datenresidenz. Regulierte Daten, eine garantierte Region oder ein privates Deployment machen aus einer einwöchigen Integration eine mehrwöchige Architekturaufgabe.
  • Integrationsfläche. Ein Agent, der eine API liest, ist billig. Einer, der in Ihr CRM, Ihre Abrechnung und Ihr Ticketing schreibt, ist ein Projekt für verteilte Systeme mit einem Modell daran.

So bewerten Sie die echte AI-Lieferfähigkeit eines Entwicklungspartners

Die Bewertung von Anbietern scheitert genauso wie die Bewertung von Kandidaten: Jeder hat ein Deck, wenige haben ein System mit echten Nutzern im Betrieb. Der AI Index Report 2026 von Stanford HAI stellte fest, dass 88 Prozent der befragten Organisationen AI inzwischen in mindestens einer Geschäftsfunktion einsetzen, während der Einsatz von Agenten in nahezu allen Funktionen im einstelligen Prozentbereich bleibt. Der größte Teil des Markts experimentiert, und Ihre Aufgabe ist es, den Teil zu finden, der das nicht tut, ob Sie AI-Entwickler in die eigene Belegschaft holen oder die Fähigkeit einkaufen. Vier Prüfungen sortieren das:

  • Fragen Sie nach der Architektur, nicht nach dem Ergebnis. Ein Partner, der einen Agenten ausgeliefert hat, beschreibt dessen Gedächtnismodell, Eskalationsregeln und Audit-Logging bereits im ersten Gespräch.
  • Prüfen Sie das Engineering darunter. Die meisten AI-Projekte scheitern als ganz normale Softwareprojekte, an schlechter Datenverrohrung und fehlender Observability. Eine lange Lieferhistorie außerhalb von AI sagt das besser voraus als ein AI-Portfolio.
  • Testen Sie die technische Passung. Fragen Sie, wer zugeteilt würde und was diese Person in genau Ihrem Stack gebaut hat. Namen und frühere Systeme bedeuten verfügbare Spezialisten, eine allgemeine Fähigkeitsbeschreibung bedeutet, dass jemand auf Ihre Kosten lernen will.
  • Fragen Sie nach, wie sie ohne vollständige Spezifikation arbeiten. Niemand weiß, was ein Modell in Ihrer Domäne kann, bevor es probiert wurde. Fragen Sie also, wie sie eine Änderung mitten im Bau aufgenommen haben.

Bei diesen letzten zwei Punkten sagen Redwerks Kunden, dass wir den Auftrag verdienen. Der AI-Scope verschiebt sich nach der ersten Evaluierungsrunde immer, und genau dann bleibt ein starrer Anbieter stehen.

Beurteilen Sie AI-Kandidaten danach, was sie ausgeliefert haben

Die Einstellungen, die funktionieren, sind selten die mit dem besten Modellvokabular. Es sind die, die zum Ergebnis passen, an Systemen mit echten Nutzern getestet wurden und in einem Modell der Zusammenarbeit stehen, das zur Dauer der Arbeit passt.

Machen Sie das falsch, ist der Fehler teuer und spät sichtbar, denn eine Demo sieht zwei Monate lang in beiden Fällen gleich aus. Wenn Sie das lieber mit Entwicklern durchsprechen, die solche Arbeit ausgeliefert haben, kontaktieren Sie uns.

FAQ

Was ist der Unterschied zwischen einem AI-Entwickler und einem ML Engineer?

Ein ML Engineer baut und pflegt Modelle: Trainingspipelines, Feature Engineering, Evaluierungsrahmen, Zeitpläne für das Neutraining. “AI-Entwickler” ist breiter und bedeutet meist einen Application Engineer, der bestehende Modelle über Orchestrierung, Tool-Calls und Gedächtnis integriert.

Wie lange dauert es 2026, einen AI-Entwickler einzustellen?

Länger als die vergleichbare Backend-Suche, weil der qualifizierte Bewerberpool kleiner ist und Gegenangebote im Senior-Bereich üblich sind. Die größere Verzögerung ist selbst verschuldet: Teams schreiben eine generalistische Rolle aus, interviewen gegen das falsche Skillset und starten neu. Vor der Veröffentlichung der Stelle zu entscheiden, welche Disziplin Sie brauchen, spart mehr Wochen als jede Sourcing-Taktik.

Kann ich einen AI-Entwickler in Teilzeit oder anteilig beauftragen?

Ja, für klar abgegrenzte Arbeit wie einen Evaluierungsrahmen, ein Architektur-Review oder einen Proof of Concept. Für alles, was unbeaufsichtigt läuft, funktioniert es schlecht, da Teilzeitmodelle Monitoring und Incident Response selten abdecken.

Auf welche Warnsignale sollte ich im Lebenslauf eines AI-Entwicklers achten?

Framework-Namen ohne beschriebene Trade-offs, Projekte, die bei einer Demo enden, keine Erwähnung von Evaluierung oder Monitoring, und die Unfähigkeit zu sagen, was abgeschaltet wurde und warum.

Was kostet ein AI-Entwicklungsteam pro Monat?

Es hängt weit mehr vom Rollenmix ab als von einem einzelnen Stundensatz. Modelltraining bringt neben Gehältern Kosten für Compute und Datenvorbereitung mit sich, während Arbeit mit gehosteten Modellen die Ausgaben zur Inferenz pro Aufruf verlagert. Bitten Sie jeden Partner, ein Angebot in Personal, Compute und Modellkosten aufzuschlüsseln.

Sehen Sie, wie wir eine AI-gestützte Recruiting-App entwickelt haben, die von einem US-Personaldienstleistungsriesen übernommen wurde.

Bitte geben Sie Ihre Geschäfts-E-Mail-Adresse ein ist keine Geschäfts-E-Mail