Eigener Praxistest · identischer Input · keine Best-of-Auswahl

Einzelaufgabe: LLM/KI-Sprachmodelle liefern.
GAP-Analyse: Struktur entscheidet.

Drei Einzeltests zeigen: Gute Prompts funktionieren. Bei neun Dokumenten und den ISO-9001-Kapiteln 4 bis 10 werden dagegen Abdeckung, Wiederholbarkeit und Belege zum entscheidenden Unterschied.

Die Kurzform:Je klarer die Einzelaufgabe, desto besser reicht ein LLM/KI-Sprachmodell. Je größer der Auditkontext, desto wichtiger wird der geführte Workflow.
Drei Aufgaben · identischer Input · bis zu 20 Wiederholungen

Wir haben denselben Prompt zehnmal eingegeben.Was ist passiert?

Bei klar abgegrenzten Aufgaben fanden die getesteten GPT-Modelle die fachlichen Kernaussagen zuverlässig. Aber sobald Bewertungslogik und Prozentformel offen blieben, änderten sich Zahlen und Einordnungen – trotz identischem Prompt.

GPT-Modelle · 20 Läufe

CAPA-Wirksamkeit

Kernbild und Hauptabweichung in 20/20 Läufen erkannt.

ErgebnisInhaltlich stabil. Bewertung variabel.

Der Reifegrad streute, weil die offene Formel in jedem Lauf neu ausgelegt wurde.

Prompt öffnen und selbst testen

„Bewerte als Senior-Auditor jeden CAPA-Vorgang nach Tiefe der Ursachenanalyse, 5M-Kategorie, adressierter Grundursache, belegter Wirksamkeit und Wiederholrisiko. Erstelle eine Tabelle, einen Gesamtreifegrad in Prozent, drei Handlungsfelder und eine Einstufung zur Hauptabweichung nach ISO 9001, Kapitel 10.2. Verwende ‚kein Nachweis‘ statt Annahmen.“

GPT-Modell · 10 Läufe

Lieferanten-Prozessaudit

Einstufung C in 10/10 Läufen; nur 2,4 % CV.

ErgebnisInhalt und Bewertung stabil.

Die feste Skala und der vorgegebene Rechenweg hielten die Ergebnisse zusammen.

Prompt öffnen und selbst testen

„Bewerte als Prozessauditor die Fragen F1 bis F16 nach der festen Punkteskala 0/4/6/8/10. Begründe jede Bewertung, kennzeichne Handlungsbedarf und berechne den Erfüllungsgrad je Abschnitt sowie insgesamt. Leite die Einstufung A/B/C unter Anwendung der Downgrade-Regeln und fünf priorisierte Maßnahmen ab.“

GPT-Modell · 10 Läufe

Managementbewertung

Zentrale Lücken in 10/10 Läufen erkannt.

ErgebnisLücken stabil. Prozentwert variabel.

Der frei berechnete Gesamtwert schwankte trotz identischem Input zwischen 45 und 73 %.

Prompt öffnen und selbst testen

„Prüfe als Zertifizierungsauditor das Protokoll der Managementbewertung gegen ISO 9001, Kapitel 9.3. Ordne jede Anforderung einer Fundstelle und dem Status ja/teilweise/nein zu, benenne fehlende Nachweise, berechne den Erfüllungsgrad und klassifiziere fehlende Eingaben als Haupt- oder Nebenabweichung. Gib konkrete Nachbesserungsempfehlungen.“

Das Ergebnis der Einzeltests

Klare Auditaufgabe, klare Führung: Die GPT-Modelle liefern.

In allen drei Aufgaben erkannten sie das fachliche Kernbild zuverlässig. Reproduzierbar wurden Zahlen und Bewertungen dort, wo der Prompt Skala und Rechenweg eindeutig vorgab.

Dein Selbsttest:Öffne einen Prompt, nutze eigene anonymisierte Unterlagen und führe ihn mehrfach in ChatGPT oder Claude aus. Vergleiche anschließend nicht nur den Text, sondern auch Prozentwerte, Einstufungen und Begründungslogik.

CAPA-Wirksamkeit: zwei GPT-Modellvarianten mit je 10 Läufen. Lieferanten-Prozessaudit und Managementbewertung: eine GPT-Modellvariante mit je 10 Läufen. Claude Opus wurde in der vollständigen GAP-Analyse im nächsten Abschnitt verglichen.

9 Dokumente · Kapitel 4 bis 10 · 10 Läufe je System

Bei der vollständigen GAP-Analyse kippt das Bild.

Aus einer Textaufgabe wird ein Auditprozess: Anforderungen abdecken, Dokumente zuordnen, offene Punkte stabil wiederfinden und Belege nachvollziehbar ausgeben.

Originale Testaufgabe anzeigen

„Ich bin vor einem externen Erstzertifizierungsaudit für ISO 9001. Anbei meine Dokumente. Führe eine komplette normorientierte GAP-Analyse durch. Zeige pro Normkapitel und Requirement, wo ich stehe und welche Punkte offen sind. Schätze den Stand je Kapitel und insgesamt in Prozent ein.“

88 konsensbasierte Fundthemen

AuditGuide vs. Ausgabe allgemeiner LLM/KI-Sprachmodelle

Stand: 09.08.2026
Funde je LaufDurchschnitt · Skala 0–67,5
AuditGuide67,5
Claude Opus30,4
GPT luna*34,0
GPT terra*32,8
Stabile Fundemindestens 8 von 10 Läufen · Skala 0–67,5
AuditGuide62
Claude Opus17
GPT luna*22
GPT terra*21
Lauf-Ähnlichkeitmittlerer Jaccard-Wert
AuditGuide84 %
Claude Opus55 %
GPT luna*58 %
GPT terra*54 %

* Eingeschränkt vergleichbar: luna und terra brachen regelmäßig vor Kapitel 8 ab. Das ist eine Ausgabekürzung, keine bewiesene Nichterkennung.

Was heißt das für dich?

Nutze KI passend zur Größe deiner Aufgabe.

Enger Scope

Nutze den Assistenten mit LLM/KI-Sprachmodell, den du schon hast.

Für einzelne CAPA-Bewertungen, Fragenkataloge oder Berichtsentwürfe liefern ChatGPT, Claude und Copilot gute Ergebnisse – wenn du Skala, Kontext und Ausgabeformat klar vorgibst und das Ergebnis prüfst.

Große, komplexe QM-Aufgabe

Verlass dich nicht auf eine einzelne plausible Chat-Antwort.

Wenn du eine Zertifizierung vorbereitest, ein komplettes Managementsystem analysierst oder Nachweise über viele Dokumente hinweg verbinden musst, brauchst du einen wiederholbaren Workflow. AuditGuide führt Normabdeckung, Fundstellen und Ergebnisse strukturiert zusammen – du behältst die Kontrolle.

Warum wir zu diesem Ergebnis kommen

Breite: AuditGuide fand im Mittel 67,5 Themen je Lauf, Claude Opus 30,4. Zusätzliche Perspektiven: AuditGuide meldete 11 Exklusivfunde, davon sieben in 90–100 % der Läufe. Nachweise: AuditGuide lieferte im Mittel 96,8 konkrete Seitenverweise pro Analyse, die allgemeinen Ausgaben der LLM/KI-Sprachmodelle keine. Die Exklusivfunde betrafen überwiegend Verknüpfungs- und Wirksamkeitsfragen – etwa Kontext → Risiko → Ziel, Scope-Review, Engineering Changes und Vorher-Nachher-Wirkung.