Ein Benchmark mit
offengelegtem Rechenweg.
Wir messen, wie oft Ihre Marke in einem definierten Satz neu erhobener Modell-API-Antworten erscheint, empfohlen und zuerst genannt wird. Sie erhalten Zahlen, Vergleiche und die Originalbelege.
Der Umfang umfasst eine Marke, Kategorie, Zielgruppe und einen globalen oder länderspezifischen Markt. Sie wählen Englisch, Deutsch oder Französisch als Fragensprache und können die Berichtssprache separat wählen. Sie genehmigen die Fragen nach der Zahlung und vor der Erhebung. Die Ergebnisse beschreiben diesen Test zu diesem Zeitpunkt. Sie schätzen weder alle KI-Gespräche noch Suchnachfrage oder Marktanteile.
Den Test festlegen.
Der Fragenkatalog wird gespeichert, bevor bezahlte Antworten erhoben werden.
Belege bewahren.
Originalantworten, Fragen, Modell-IDs, Erhebungszeiten und zurückgegebene Quellen bleiben mit dem Bericht verknüpft.
Die Rechnung zeigen.
Anzahlen und Bezugsgrössen stehen neben den Prozentsätzen. Fehlende Analysen bleiben sichtbar.
KI für die Interpretation. Code für die Messung.
Wir bevorzugen deterministische Regeln, wo sie die Aufgabe erfüllen. Software erstellt den bezahlten Fragenkatalog, prüft die Erhebungsintegrität, ruft Zitate ab und berechnet Kennzahlen. Kein Modell soll dabei eine Zahl improvisieren.
Wo KI hilfreich ist
Die Anbieter erzeugen die zu messenden Antworten. Modelle interpretieren auch Website-Kontext, klassifizieren Empfehlungen, prüfen mehrdeutige Produktidentitäten und helfen, Belege in konkrete Aufgabenbriefings umzusetzen.
Wo Regeln übernehmen
Validierung, unterstützter Namensabgleich, Deduplizierung, Bezugsgrössen, Prozentsätze und Platzierungen folgen definiertem Code. Mit denselben gespeicherten Eingaben, akzeptierten Einstufungen, Identitätsentscheidungen und derselben Codeversion ist die Rechnung wiederholbar.
Deterministisches Zählen macht eine KI-Einstufung nicht unfehlbar. Eine wiederholte Erhebung oder Interpretation kann Belege oder Einstufungen verändern. Wir bewahren das Protokoll, zeigen die Abdeckung und verknüpfen Befunde mit Originalantworten, damit Sie das Ergebnis prüfen können.
«Wer wird bei den getesteten Kaufentscheidungen statt uns empfohlen – und auf welche Belege können wir unser Handeln stützen?»
Die Frage kontrollieren.
Dann wiederholen.
Sie geben zwei bis fünf Käuferbedürfnisse und zwei bis zehn Mitbewerber an. Jedes Bedürfnis wird nach denselben fünf Kriterien geprüft: Gesamteignung, Preis-Leistungs-Verhältnis, Qualität, Kundenerfahrung und Einfachheit der Einführung.
Jedes Bedürfnis erhält fünf Kriterien. Eine zusätzliche Gruppe prüft die Kategorie ohne Zielgruppe oder Käuferbedürfnisse. Weniger Bedürfnisse bedeuten mehr Wiederholungen, keinen niedrigeren Preis.
Die vollständige Stichprobentabelle
| Käuferbedürfnisse | Unterschiedliche Fragen | Wiederholungen je Modell | Antworten insgesamt |
|---|---|---|---|
| 2 | 22 | 8 | 704 |
| 3 | 32 | 5 | 640 |
| 4 | 42 | 4 | 672 |
| 5 | 52 | 3 | 624 |
Wir wählen die kleinste ganze Zahl an Wiederholungen, die mindestens 624 Antworten ergibt, mindestens jedoch drei. Das ist ein Erhebungsziel, keine Berechnung statistischer Teststärke. «Über 600 Antworten» enthält Wiederholungen über Modelle hinweg und bedeutet nicht 600 einzigartige Fragen oder unabhängige Käufer.
Was das Erhebungsmodell tatsächlich sieht
Kategorie, Zielgruppe, Markt, Käuferbedürfnis und Kaufkriterium werden in eine feste Vorlage eingesetzt. Zielmarke, Website und Mitbewerberliste werden nicht als separater Erhebungskontext mitgegeben. Die Validierung blockiert erkannte erfasste Namen, URLs und ausgewählte Anweisungsmuster im Briefing.
Welche Optionen aus der Kategorie „Projektmanagement-Software“ würden Sie für die Zielgruppe „wachsende Teams“ und den Bedarf „Zusammenarbeit im Team“ in Betracht ziehen? Zielmarkt: Schweiz. Vergleichen Sie geeignete Optionen hinsichtlich „Gesamteignung“ und erläutern Sie die Vor- und Nachteile. Wenn sich keine geeignete Option feststellen lässt, sagen Sie dies ausdrücklich. Weichen Sie nicht auf eine andere Produktkategorie aus.
Eine separate Gruppe nur nach Kategorie entfernt Zielgruppe und Einzelbedürfnisse. Sie ist im Gesamtwert enthalten und wird im Messprotokoll gesondert gezeigt. Sie bietet einen breiteren Vergleich, keinen Kausaltest auf Verzerrung.
Wie Website-Vorschläge das Briefing beeinflussen
Die Website-Vorschau kann ein Modell verwenden, um öffentliche Texte in die gewählte Fragensprache einzuordnen und Kategorie, Zielgruppe, Markt und Bedarf vorzuschlagen. Deterministische Extraktion bleibt ein Ausgangspunkt. Vorschläge beim Bearbeiten des bezahlten Briefings müssen ebenfalls geprüft werden. Sie beschreiben die Website des Anbieters, nicht gemessene Kundennachfrage.
Sie prüfen das bezahlte Briefing und genehmigen den gesamten Fragenkatalog. Wählen Sie Bedürfnisse anhand echter Verkaufsgespräche, Kundeninterviews oder Supportanfragen. Namensprüfungen verhindern nicht, dass sehr spezifische Funktionskombinationen einen Anbieter bevorzugen. Hinweise markieren ausgewählte Werbeformulierungen, überladene Beschreibungen und ähnliche Bedürfnisse; sie erkennen nicht jede suggestive Frage.
Vier Anbieter.
Eine dokumentierte Konfiguration.
Wir verwenden eine konfigurierte Modell-API pro Anbieter. Jede erhält dieselben genehmigten Fragen und dieselbe Anzahl an Wiederholungen. Es sind neue Anfragen ohne Chatverlauf oder Personalisierung eines Endnutzerkontos.
OpenAI
openai/gpt-5-miniGemini
google/gemini-3-flashClaude
anthropic/claude-sonnet-4.6Perplexity
perplexity/sonarAktuelle Standardwerte. Die gespeicherten Modell-IDs und Erhebungszeiten Ihres Berichts dokumentieren diesen Lauf. Anbieter-Aliase und Suchergebnisse können sich ändern.
Suche, Standort und Generierungseinstellungen
OpenAI, Gemini und Claude haben native Websuchtools aktiviert; das Modell kann über deren Einsatz entscheiden. Perplexity verwendet sein suchfähiges Sonar-Modell. Aufrufe laufen über Vercel AI Gateway. Suchverfügbarkeit und Verhalten unterscheiden sich nach Anbieter. Verglichen werden daher die konfigurierten Systeme, nicht isoliert die Modellfähigkeiten.
Antworten Sie auf Deutsch mit höchstens 300 Wörtern. Verwenden Sie bei Bedarf höchstens eine Websuchanfrage.
OpenAI verwendet niedrigen Suchkontext und geringen Reasoning-Aufwand. Claudes Suchtool ist auf eine Nutzung begrenzt. Die Vorgaben einer Suchanfrage und 300 Wörter sind Anweisungen, keine Garantie identischer Umsetzung. Das Ausgabelimit beträgt 4.000 Tokens; leere oder wegen Längenlimits abgebrochene Antworten werden abgelehnt. Wir setzen keine gemeinsame Temperatur oder Zufallszahlbasis.
Technische Fehler können mit der gespeicherten Frage erneut versucht werden. Bei der Wiederherstellung bleiben erfolgreiche Antworten erhalten und werden nicht erneut erhoben.
Das gewählte Land steht in der Frage. «Global» verwendet weltweite Formulierungen. Keine Einstellung zieht Nutzerstichproben nach Land oder bestätigt lokale IP-Zustellung. Ergebnisse sind Beobachtungen in der gewählten Fragensprache ohne regionale Zielgruppengewichtung. Originalantworten werden für die Messung nicht übersetzt.
Dieser Bericht bildet die Apps ChatGPT, Gemini, Claude oder Perplexity samt Standardmodellen, Personalisierung oder oberflächenspezifischer Suche nicht nach. Anbieternamen benennen die getesteten Systeme; sie bedeuten keine Partnerschaft oder Empfehlung.
Die Bezugsgrösse
verändert die Aussage.
KI-Share-of-Voice ist der Anteil einer Marke an den gezählten Markennennungen in einem definierten Satz KI-Antworten. Jede Marke zählt pro Antwort höchstens einmal, auch bei mehreren Nennungen. Ein Modell klassifiziert die Antwort; Code prüft die Belege und summiert die Zahlen.
Dieselben 12 Nennungen.
Drei verschiedene Kennzahlen.
Nennungsrate. Wie oft die Marke in einer Antwort vorkam.
Share of Voice der ausgewählten Marken. Abhängig von Ihrer Mitbewerberauswahl.
Share of Voice der entdeckten Optionen. Enthält relevante Alternativen ausserhalb Ihrer Liste.
Eine Antwort kann mehrere Marken nennen. Marken-Antwort-Nennungen können daher die Zahl der Antworten übersteigen. «Alle identifizierten Optionen» meint die in dieser Analyse gefundenen, nicht sämtliche Anbieter im Markt.
- Genannt
- Antworten mit extrahierter Markennennung ÷ analysierte Antworten. Eine Nennung kann positiv, negativ oder beiläufig sein.
- Empfohlen
- Für die Marke als «empfohlen» oder «beste Wahl» eingestufte Antworten ÷ analysierte Antworten. Einschränkungen, Alternativen und Gegenempfehlungen bleiben eigene Einstufungen.
- Zuerst genannt
- Antworten, in denen die Marke unter den beibehaltenen Entitäten zuerst erscheint ÷ analysierte Antworten. Die Textreihenfolge allein belegt keine Präferenz.
- Ihre Website in den Quellen
- Erfolgreiche Antworten mit Zitat Ihrer Domain oder Subdomain ÷ alle erfolgreichen Antworten. Diese Kennzahl setzt keine erfolgreiche Extraktion voraus.
- Teilbare Platzierung
- Platzierung nach Empfehlungszahl innerhalb des gewählten Berichtsumfangs. Gleichstände teilen sich eine Platzierung (1, 2, 2, 4). Platzierungskarten erfordern vollständige Erhebung und Analyse, alle vier Anbieter, mindestens 24 analysierte Antworten im Umfang und mindestens eine Empfehlung Ihrer Marke. Eine Karte für ein Käuferbedürfnis beschreibt diese Teilmenge, keine gesamte Marktposition. Die stärkste Teilmenge ist nicht automatisch repräsentativ für den Bericht.
Aliase, Kategoriezugehörigkeit und Quellen
Vom Kunden angegebene Zielmarken-Aliase und unterstützte Domain-Schreibweisen werden zusammengefasst. Eine separate quellenbasierte Identitätsprüfung kann Verweise auf dasselbe Produkt zusammenführen oder Kategorie-/Kanalbezeichnungen entfernen. Unsichere Treffer bleiben getrennt; fehlende oder unvollständige Prüfung wird offengelegt. Originalantworten bleiben unverändert.
Entdeckte Mitbewerber müssen als relevante Optionen klassifiziert sein; Integrationspartner und beiläufige Fremdmarken werden ausgeschlossen. Nennungen der Zielmarke bleiben auch bei beiläufigem oder kategoriefremdem Bezug erhalten. «Genannt» ist daher breiter als «als geeignete Option empfohlen». Einstufungen können falsch sein; prüfen Sie die Originalantwort.
Zitierte Quellen sind Links, die der Anbieter mit der Antwort verknüpft: ChatGPT-Annotationen, Claudes Zitate, nummerierte Perplexity-Verweise und Gemini-Grounding-Quellen. Suchanfragen und Suchergebnisse werden separat gespeichert. Vor Oktober 2026 erhobene Berichte listen Claude- und Perplexity-Suchergebnisse als Quellen. Bei einigen Gemini-Weiterleitungen liefert ein domainartiger Titel einen unbestätigten Host; dies wird gekennzeichnet. Eine aufgeführte Quelle beweist weder das Zitieren einer bestimmten Passage noch die Richtigkeit der Seite oder einen Einfluss auf die Empfehlung.
Prüfungen, die Sie einsehen können.
Das Messprotokoll zeigt, was bestanden wurde, was bewertet wurde und was fehlt. Jede Schutzmassnahme adressiert einen bestimmten Fehlerfall; keine bestätigt Neutralität.
Genehmigte Fragen bleiben erhalten
Der bezahlte Fragenkatalog steht vor der Erhebung fest. Antworten werden neu erhoben; günstige Vorschauantworten werden nicht übernommen. Fragen werden nicht aufgrund von Ergebnissen umgeschrieben.
Die tatsächlichen Anfragen werden geprüft
Jede geplante Kombination aus Frage, Formulierung, Anbieter und Wiederholung muss genau einmal vorliegen. Die Integritätsprüfung vergleicht zudem gespeicherte und genehmigte Fragen.
Die Extraktion kennt die Kundenidentität nicht
Das Extraktionsmodell erhält Frage, Kategorie und Antwortpassagen. Es erfährt weder die Kundenmarke noch die Mitbewerberliste oder den Antwortanbieter. Namen bleiben im Text: Die Annotation ist zielmarkenblind, nicht anonymisiert. Die Zuordnung zur Zielmarke erfolgt danach im Code.
Zitate stammen aus der gespeicherten Antwort
Code ruft Originalpassagen ab und gleicht Namen und Zitate mit dem Antworttext ab. Das Modell klassifiziert, erfindet aber keinen Zitattext. Die Quellenprüfung bestätigt die Existenz von Belegen, nicht die Richtigkeit der Einstufung oder Produktaussage.
Unhilfreiche Antworten bleiben im Protokoll
Derselbe Extraktionsaufruf bewertet, ob die Antwort thematisch passt, gemischt, themenfremd oder unklar ist. Analysierte themenfremde und unklare Antworten bleiben in der Bezugsgrösse. Fehlende Bewertungen gelten als «nicht bewertet», nie automatisch als bestanden.
Validierungsstatus und Fertigstellungsschwelle
Regressionstests prüfen Namenslecks in Fragen, Anfrageintegrität, ausgewogene Erhebung, Quellenbindung, Deduplizierung und Bezugsgrössen. Entwicklerklassifizierte synthetische Beispiele und ein separater synthetischer Testsatz prüfen Extraktion und Fragenbezug. Dies ist interne Validierung, kein unabhängiges Audit und keine veröffentlichte branchenübergreifende Genauigkeitsschätzung unter Realbedingungen.
Das Extraktionsmodell ist OpenAI GPT-5 mini, auch für OpenAI-Antworten. Das Ausblenden des Anbieters beseitigt weder Modellfamilieneffekte noch Erkennung aus dem Text oder systematische Klassifikationsfehler. Routinemässige menschliche Annotation oder ein unabhängiges zweites Extraktionsmodell werden nicht zugesichert.
Ein abgeschlossener bezahlter Bericht erfordert jede geplante gültige Antwort und beleggebundene Analyse für mindestens 95 % davon. Die 95 % sind eine Lieferschwelle, kein Konfidenzniveau. Fehlgeschlagene Analysen werden aus abgeleiteten Markenbezugsgrössen ausgeschlossen; die Abdeckung wird gezeigt. Sie zählen nie als Abwesenheit. Wird die Schwelle nicht erreicht, geht der Bericht zur Prüfung statt als vollständig veröffentlicht zu werden. Teilbare Platzierungskarten erfordern strengere 100 % Analyse.
Wiederholbares Verfahren.
Variable Antworten.
Wiederholungen zeigen Schwankungen innerhalb dieser Erhebung. Sie machen daraus keine Zufallsstichprobe der Käufernachfrage. Verwandte Fragen, gemeinsame Suchquellen und Modellverhalten können Antworten voneinander abhängig machen.
Was wir zeigen
Zahlen je Anbieter und Wiederholung. Nennungsratenunterschiede der zwei Formulierungen anhand übereinstimmender Frage-/Wiederholungspaare mit beidseitig analysierten Antworten. Eine separate Kategorieansicht. Abdeckung neben dem Ergebnis.
Was daraus folgt
Beobachtete Schwankung in der getesteten Konfiguration. Daraus folgen weder eine Fehlermarge für eine Grundgesamtheit noch eine Empfehlungswahrscheinlichkeit oder ein unverzerrtes Ergebnis. Wir veröffentlichen keinen unbelegten Konfidenzwert.
Jedes Modell erhält denselben Erhebungsumfang. Gesamtraten fassen analysierte Antworten zusammen; bei fehlenden Analysen können Anbieter leicht unterschiedliche Anzahlen beitragen. Extraktionsfehler können systematisch sein, sodass ihr Ausschluss das Ergebnis beeinflussen kann. Die Mischung ist nicht nach Marktanteil, Fragenpopularität oder Nutzung Ihrer Kunden gewichtet.
Einen späteren Bericht vergleichen
Halten Sie Kategorie, Zielgruppe, Markt, Bedürfnisse, genehmigte Formulierungen, erfasste Namen und Aliase konstant. Prüfen Sie Modell-IDs, Erhebungs- und Analyseversionen, Daten, Quellenmix und Abdeckung, bevor Sie eine Änderung interpretieren.
Anbieterupdates, Live-Suche und Antwortschwankungen können Ergebnisse verändern, auch wenn Ihre Website gleich bleibt. Ein neuer Lauf kann dasselbe Verfahren mit anderen Antworten ergeben. Ein Vorher-Nachher-Unterschied allein belegt keine Wirkung einer Content-Änderung, Bewertungskampagne oder anderen Massnahme.
Ein Befund sollte
einen Ausgangspunkt bieten.
Der bezahlte Bericht enthält einen priorisierten Arbeitsplan. Jede Aufgabe verbindet einen beobachteten Unterschied mit Belegantworten, vorgeschlagener Verantwortung, Aufwandsschätzung, Abschlusskriterien und einer Ausgangsmessung.
Im Fokus steht Marketingarbeit: klarere Website-Inhalte, hilfreiche redaktionelle Inhalte, korrekte externe Profile und Bewertungen sowie die Korrektur unbelegter Aussagen. Eine fehlende Formulierung beweist keine fehlende Produktfunktion. Produktänderungen lassen sich aus diesem Benchmark allein nicht ableiten.
Was Website- und Massnahmenprüfung abdecken
Wir prüfen eine begrenzte Zahl öffentlicher HTML-Seiten und versuchen robots.txt zu prüfen. Eine optionale vertiefte Prüfung nutzt Sitemap-Funde, weitere eigene Seiten und ausgewählte zitierte externe Seiten. Seiten-, Grössen- und Zeitlimits sowie Crawlerausschlüsse gelten; erfolgreiche Teilprüfungen bleiben erhalten. Dies ist eine gezielte Belegprüfung, kein vollständiges Website-Audit.
Wenn geeignete Belege und Budget verfügbar sind, entwirft ein begrenzter Modellaufruf konkretere Briefings; ein separater Aufruf prüft sie kritisch. Zitate müssen geprüftem Text entsprechen und Ausgangswerte bleiben erhalten. Bei fehlender oder ungültiger Ergänzung bleibt die beleggebundene Checkliste. Dies ist eine automatisierte Prüfung, keine menschliche Beratung.
Der Crawl rendert kein JavaScript, bestätigt keine Suchindexaufnahme, prüft nicht jede Seite und testet keinen Zugriff aus dem Anbieternetzwerk. Eine im begrenzten Crawl fehlende Seite ist kein Beweis ihrer Nichtexistenz. Gemeinsames Auftreten von Quellen beweist keinen Einfluss. Aufgaben sind zu prüfende Hypothesen ohne Versprechen zu Platzierung, Traffic oder Umsatz.
Die Details bleiben
beim Ergebnis.
Der Bericht bewahrt genehmigte Fragen, Originalantworten und zurückgegebene Quellen. Das Messprotokoll zeigt Erhebungsintegrität, Analyseabdeckung, Umfangsprüfungen und Formulierungsunterschiede. Modell-IDs und Versionen zeigen, welche Methode das Ergebnis erzeugt hat.
Was Sie prüfen können
Umfang, Stichprobendesign, Zählregeln, Modellkonfiguration und Grenzen sind öffentlich. Ihr Bericht ergänzt genehmigte Fragen, Antworten und Belege, um Befunde zu hinterfragen. Eine reproduzierbare Rechnung wendet dieselben Regeln auf denselben gespeicherten Datensatz an; sie verspricht keine identischen Antworten eines neuen Laufs.
Quellcode, interne Analyseanweisungen und betriebliche Abstimmung bleiben proprietär. Sie müssen diese nicht lesen, um eine ausgewiesene Zahl zu prüfen. Methode und Belege lassen sich hinterfragen, ohne die zugrunde liegende Software zu veröffentlichen.
- Fragenprotokoll
buyer-panel-v2 (EN) · buyer-panel-v3-de / -fr- Erhebungsprotokoll
api-search-de-300w-v1- Analyseversion
report-v2.1- Extraktionsmodell
source-anchored-v4-multilingual- Erhebungsaufteilung
- Gleich über Anbieter und genehmigte Fragen
- Zähleinheit
- Eine beibehaltene Marke je Antwort, einmal gezählt
- Forschungsbetreiber
- Share of Voice by Serge · Superstellar LLC
- Methode geprüft am
Kostenlose Vorschauen, ältere Berichte und Korrekturen
Eine kostenlose Vorschau prüft eine aus der Website abgeleitete Frage über vier Anbieter, ohne Breite und Wiederholungen des bezahlten Katalogs. Geeignete Vorschauen können bis zu 24 Stunden aus dem Cache kommen. Erhebungszeit und Umfang gehören zum Ergebnis. Eine bezahlte Bestellung erhebt nach Genehmigung einen neuen Fragenkatalog.
Das öffentliche Beispiel nutzt eine fiktive Marke und illustrative Antworten. Es zeigt die Berichtsnutzung, keinen Live-Benchmark und kein Validierungsergebnis.
Ältere Berichte behalten gespeicherte Fragen und Analysen. Das frühere Protokoll kombinierter Bedürfnisse und die exakte Namensbewertung sind nicht direkt mit dem aktuellen Katalog vergleichbar. Alte Extraktionen werden nicht nachträglich als zielmarkenblind bezeichnet. Beachten Sie die jeweils dokumentierte Methode.
Wenn ein Name falsch klassifiziert wurde oder eine Zahl nicht aufgeht, kontaktieren Sie uns unter hello@shareofvoice.app mit Berichts- und Antwortreferenz. Wir können die Belege untersuchen, aber nicht jede Anbieteraussage als wahr bestätigen.
Die Überlegungen hinter
der Methode.
Diese Quellen prägen unsere Entscheidungen zu Offenlegung, Fragenvariation und modellbasierter Analyse. Sie zertifizieren Share of Voice nicht und validieren unseren kommerziellen Bericht nicht.
- 01HELM: Holistic Evaluation of Language ModelsStanford CRFM · Liang et al., 2022
A model-evaluation framework that makes scenarios, metrics, prompts and outputs inspectable. Relevant to our evidence-first reporting, not a validation of our scores.
- 02Standards for DisclosureAmerican Association for Public Opinion Research
A useful disclosure reference for exact wording, sampling, weighting, processing and limits. Our benchmark is a model-output study, not a survey of people or an AAPOR-certified study.
- 03ProSA: Assessing and Understanding the Prompt Sensitivity of LLMsZhuo et al. · Findings of EMNLP, 2024
Documents sensitivity to prompt wording across models and tasks. Our two phrasings expose some variation; they cannot cover every way a buyer might ask.
- 04Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-JudgeShi et al. · IJCNLP–AACL, 2025
Studies position bias in model-based judging. Its setting differs from our extraction task; it supports treating model labels as fallible, not borrowing an accuracy claim.
Öffnen Sie einen Bericht.
Folgen Sie den Belegen.
Erkunden Sie das illustrative Beispiel von der Kernaussage bis zu Einzelantworten und Massnahmenplan.
Beispielbericht prüfen USD 179 pro bezahltem Bericht. Monatliche Berichte optional.