Zuletzt aktualisiert im Oktober 2026. Preise, Tarifstruktur und Anbieterfunktionen unten entsprechen dem Stand der veröffentlichten Anbieter-Websites zum Zeitpunkt der Erstellung.
Die meisten Scorecards für Anbieter schreibt das Vertriebsteam des Anbieters selbst, und man merkt es. Die Fragen bevorzugen das, was dieser Anbieter bereits gut kann, und lassen die Kategorien aus, in denen ein Wettbewerber gewinnen würde. Eine G2-Studie zur „Answer Economy” aus dem Jahr 2026 ergab: 51 % der B2B-Softwarekäufer starten ihre Kaufrecherche inzwischen in einem KI-Chatbot, gegenüber 29 % ein Jahr zuvor. Das macht die Software, die diesen Kanal misst, zu einer echten Einkaufsentscheidung und nicht zu einem Nebenkauf.
Diese Scorecard ist anbieterneutral. Sie stellt jeder Plattform auf deiner Shortlist dieselben 40 Fragen, gewichtet die Antworten auf die gleiche Weise und markiert die Antworten, die einen Käufer unabhängig vom Anbieter beunruhigen sollten. Nutze sie so, wie sie ist, oder passe die Kategorie-Gewichtung an die Prioritäten deines Teams an, bevor du sie verschickst.
So verwendest du diese Scorecard
Schicke die acht Kategorietabellen unten an jeden Anbieter auf deiner Shortlist, oder geh sie gemeinsam in einer Live-Demo durch. Vergib für jede Frage die volle Punktzahl bei einer starken, belegten Antwort, die halbe Punktzahl bei einer vagen oder unvollständigen Antwort und null Punkte bei einem Red Flag.
Addiere die Punkte innerhalb jeder Kategorie und anschließend die acht Kategoriesummen zu einem Gesamtwert von 100 Punkten. Ein Anbieter, der eine Frage gar nicht beantworten kann, bekommt dafür null Punkte, genau wie bei einem Red Flag.
Auf einen Blick: die 8 Kategorien
| Kategorie | Gewichtung | Was sie prüft |
|---|---|---|
| Engine-Abdeckung und Datenaktualität | 20 | Welche Engines sie abdeckt und wie aktuell die Daten sind |
| Prompt-Methodik und -Herkunft | 15 | Woher die Prompts stammen und wie transparent der Nachweis ist |
| Metriken und Messqualität | 15 | Ob die Zahlen einer genauen Prüfung standhalten |
| Handlungs- und Umsetzungsfähigkeit | 15 | Ob sie Lösungen liefert oder nur Lücken aufzeigt |
| Reporting und Integrationen | 10 | Ob die Daten in den Tools ankommen, die dein Team bereits nutzt |
| Sicherheit, Compliance und Governance | 10 | Ob Einkauf und Rechtsabteilung zustimmen können |
| Support und Onboarding | 10 | Wie schnell du zu einem nutzbaren ersten Ergebnis kommst |
| Preise und Vertragsbedingungen | 5 | Ob die tatsächlichen Kosten sichtbar sind, bevor du unterschreibst |
Für einen ausführlicheren Vergleich von Preisen und Engine-Abdeckung über die RFP-Fragen hinaus, sieh dir das vollständige Tool-Ranking an.
Kategorie 1: Engine-Abdeckung und Datenaktualität (20 Punkte)
Diese Kategorie hat das höchste Gewicht, weil eine Lücke in der Überwachung hier jede andere Kennzahl auf der Scorecard untergräbt. Eine Plattform, die ChatGPT verfolgt, aber Google AI Overviews auslässt, beantwortet nur die Hälfte der Frage deiner Käuferinnen. Profound deckt in seinem Growth-Tarif neun oder mehr Engines ab und rechnet diese Tiefe in den Preis ein. Peec AI startet schlank mit drei Modellen und berechnet zusätzliche Engines als Add-ons. Verlange von jedem Anbieter, beides zu zeigen, nicht nur zu beschreiben.
| # | Frage | Punkte |
|---|---|---|
| 1 | Welche KI-Engines verfolgt die Plattform heute, und ist Google AI Overviews standardmäßig enthalten oder nur als Add-on erhältlich? | 4 |
| 2 | Wie oft werden die Daten für jede verfolgte Engine aktualisiert, und ändert sich die Aktualisierungsgeschwindigkeit je nach Tarif? | 4 |
| 3 | Werden Google AI Overviews und Gemini als separate, klar gekennzeichnete Flächen verfolgt? | 4 |
| 4 | Was passiert mit historischen Trenddaten, wenn der Anbieter eine Engine hinzufügt oder entfernt? | 4 |
| 5 | Können wir eine neue Engine zu einem bestehenden Prompt-Set hinzufügen, ohne das komplette Onboarding zu wiederholen? | 4 |
Kategorie 2: Prompt-Methodik und -Herkunft (15 Punkte)
Zwei Anbieter können exakt denselben Share-of-Voice-Wert aus zwei völlig unterschiedlichen Prompt-Sets melden, und nur eines dieser Sets spiegelt wider, wie deine Käuferinnen tatsächlich suchen. Ahrefs Brand Radar baut sein Prompt-Korpus aus einer Datenbank mit mehr als 405 Millionen echten Suchanfragen auf, erhoben über sechs KI-Plattformen hinweg. Das AI Visibility Toolkit von Semrush entdeckt Prompts automatisch aus dem Keyword-Universum, das bereits in deinem Semrush-Konto vorhanden ist. Keiner der beiden Ansätze ist falsch, aber sie erzeugen unterschiedliche Prompt-Sets. Deine RFP sollte jeden Anbieter dazu zwingen, vor dem Vertragsabschluss zu benennen, welches Set du kaufst.
| # | Frage | Punkte |
|---|---|---|
| 6 | Stammen die Prompts aus echten Such- oder Chat-Anfragedaten, werden sie manuell vom Käufer geschrieben, oder werden sie automatisch aus einer bestehenden Keyword-Liste ermittelt? | 3 |
| 7 | Wie viele Prompt-Varianten pro Intention verfolgt die Plattform standardmäßig, und gibt es im Basistarif eine feste Obergrenze? | 3 |
| 8 | Zeigt die Plattform den exakten Prompt-Text und die Engine-Antwort hinter einer bewerteten Zitation, oder nur einen aggregierten Prozentwert? | 3 |
| 9 | Wie geht die Plattform mit Prompt-Drift um, also damit, Prompts auszusortieren, die nicht mehr widerspiegeln, wie Käufer die Frage formulieren? | 3 |
| 10 | Sind Prompt-Daten auf Wettbewerbsebene in derselben Oberfläche sichtbar, oder nur die Ergebnisse der eigenen Marke? | 3 |
Kategorie 3: Metriken und Messqualität (15 Punkte)
Ein Dashboard, das auf einem einzigen Durchlauf basiert, meldet Rauschen, kein Signal, denn Answer Engines sind probabilistisch, und eine einzelne Antwort ist nur eine Stichprobe aus einer Verteilung. Diese Kategorie prüft, ob die Zahlen des Anbieters ein internes Audit überstehen würden, bevor dein Team sie nach oben präsentiert.
| # | Frage | Punkte |
|---|---|---|
| 11 | Meldet die Plattform Share of Voice, Markenerwähnungen, Citation Rate und Sentiment als 4 getrennte Kennzahlen, oder fasst sie diese zu einem einzigen Wert zusammen? | 3 |
| 12 | Wie viele Durchläufe pro Prompt erhebt die Plattform, bevor sie einen Prozentwert meldet? | 3 |
| 13 | Können wir Rohdaten auf Prompt-Ebene exportieren, oder nur die aggregierte Dashboard-Ansicht? | 3 |
| 14 | Unterscheidet die Sentiment-Bewertung zwischen positiv, neutral und negativ, oder liefert sie nur ein binäres Ergebnis? | 3 |
| 15 | Wie kennzeichnet die Plattform sachliche Fehler über unsere Marke, getrennt vom Sentiment? | 3 |
Kategorie 4: Handlungs- und Umsetzungsfähigkeit (15 Punkte)
Die meisten Plattformen hören beim Dashboard auf: Sie zeigen dir die Lücke und übergeben die Lösung an dein Team. Temso schließt diese Lücke ab 89 €/Monat. Das Dashboard verwandelt eine Sichtbarkeitslücke innerhalb desselben Abos in eine priorisierte Lösungsliste und einen Content-Brief, und der AI-SEO-Agent kann einen Teil dieser Empfehlungen direkt umsetzen, mit einem menschlichen Prüfschritt, bevor irgendetwas veröffentlicht wird. Frag jeden Anbieter, ob „Handlung” eine generische Checkliste bedeutet oder eine Lösung, die an deine tatsächliche Lücke gekoppelt ist.
| # | Frage | Punkte |
|---|---|---|
| 16 | Wenn die Plattform eine Sichtbarkeitslücke findet, liefert sie eine priorisierte, gerankte Lösung, oder bleibt sie beim Dashboard stehen? | 3 |
| 17 | Kann die Plattform ein Content-Briefing oder einen Entwurf erstellen, der an einen bestimmten Prompt gekoppelt ist, bei dem ein Wettbewerber vorn liegt? | 3 |
| 18 | Behebt die Plattform Zitationslücken bei Drittquellen, oder gibt sie nur Empfehlungen für eigene Inhalte? | 3 |
| 19 | Automatisiert die Plattform einen Teil der Umsetzung, und was genau passiert ohne menschliche Prüfung? | 3 |
| 20 | Wie bestätigt die Plattform, ob eine umgesetzte Lösung die Lücke in den folgenden Wochen tatsächlich geschlossen hat? | 3 |
Kategorie 5: Reporting und Integrationen (10 Punkte)
Daten, die nur im Dashboard eines Anbieters existieren, erreichen selten die Menschen, die danach handeln müssen. Diese Kategorie prüft, ob die Plattform Belege in die Tools schiebt, die dein Team bereits einsetzt. Peec AI liefert zum Beispiel native Konnektoren zu Slack und BI-Tools, statt Export und Import als Hausaufgabe für die Analystin zu belassen.
| # | Frage | Punkte |
|---|---|---|
| 21 | Können Reports geplant und als PDF, CSV oder per API exportiert werden, ohne manuelles Kopieren und Einfügen? | 2 |
| 22 | Lässt sich die Plattform mit Tools integrieren, die du bereits nutzt, etwa Slack, ein BI-Tool oder GA4? | 2 |
| 23 | Kannst du eine separate Dashboard-Ansicht für eine Management-Zusammenfassung im Gegensatz zu Detailtiefe auf Analystenebene erstellen? | 2 |
| 24 | Ist eine öffentliche API im Basispreis enthalten, oder nur gegen ein kostenpflichtiges Add-on verfügbar? | 2 |
| 25 | Können mehrere Marken oder Properties von einem Konto aus verwaltet werden, ohne doppelte Logins? | 2 |
Kategorie 6: Sicherheit, Compliance und Governance (10 Punkte)
Das ist die Kategorie, die einen Deal komplett stoppen kann, nicht nur Punkte kostet. Hol dir jede Antwort hier schriftlich, bevor der Vertrag unterschrieben wird, nicht erst während des Onboardings.
| # | Frage | Punkte |
|---|---|---|
| 26 | Ist der Anbieter SOC-2-Type-II-zertifiziert, und kann er den Bericht auf Anfrage vorlegen? | 2 |
| 27 | Unterstützt die Plattform SSO und rollenbasierte Zugriffskontrolle? | 2 |
| 28 | Wo werden Kundendaten gehostet, und gibt es eine dokumentierte Richtlinie zu Aufbewahrung und Löschung? | 2 |
| 29 | Enthält der Vertrag eine Auftragsverarbeitungsvereinbarung, die die DSGVO-Anforderungen abdeckt? | 2 |
| 30 | Wem gehören das Prompt-Set und die historischen Daten nach einer Kündigung, und können wir vorher alles exportieren? | 2 |
Kategorie 7: Support und Onboarding (10 Punkte)
Ein Tool mit perfekten Daten ist wertlos, wenn dein Team nie über die Einrichtung hinauskommt. In dieser Kategorie verlieren Budget-Plattformen am häufigsten Punkte, da dedizierter Support meist den höheren Tarifen vorbehalten ist.
| # | Frage | Punkte |
|---|---|---|
| 31 | Wie sieht das Onboarding am ersten Tag aus: eine geführte Einrichtung, eine feste Ansprechperson, oder ein Self-Service-Assistent ohne menschlichen Kontakt? | 2 |
| 32 | Wie lange dauert es im Durchschnitt von der Anmeldung bis zu einem nutzbaren ersten Dashboard? | 2 |
| 33 | Ist Kundensupport in jedem Tarif enthalten, oder nur in den teureren Plänen? | 2 |
| 34 | Bietet der Anbieter Schulungen oder Dokumentation für ein Team ohne dedizierte AEO-Analystin? | 2 |
| 35 | Welchen Prozess hat der Anbieter, um eine Erwähnung oder einen Sentiment-Wert anzufechten, den du für falsch hältst? | 2 |
Kategorie 8: Preise und Vertragsbedingungen (5 Punkte)
Die tatsächlichen Kosten einer AI-Visibility-Plattform stehen selten auf der Preisseite. Der Starter-Tarif von Profound deckt für 99 €/Monat nur ChatGPT ab, echte Abdeckung gibt es erst im Growth-Tarif für 399 €/Monat. Das AI Visibility Toolkit von Semrush ist ein Add-on für 99 €/Monat, das einen kostenpflichtigen Semrush-Pro-Tarif ab 139,95 €/Monat voraussetzt, bevor es sich aktivieren lässt. Der Starter-Tarif von Peec AI kostet 85 €/Monat, mit zusätzlichen Engines als Add-ons für jeweils 30 bis 140 €/Monat. Temso hat drei feste Tarife, 89 €, 199 € und 499 € pro Monat, mit unbegrenzten Projekten, Nutzern und Empfehlungen in jedem davon, plus 15 % Rabatt bei jährlicher Zahlung.
| # | Frage | Punkte |
|---|---|---|
| 36 | Sind die Preise veröffentlicht, oder erfordert jedes Angebot ein Vertriebsgespräch? | 1 |
| 37 | Werden Engines, Nutzer oder Prompt-Volumen als kostenpflichtige Add-ons abgerechnet, oder sind sie im Basispreis enthalten? | 1 |
| 38 | Gibt es eine kostenlose Testphase oder Pilotperiode, und wird dafür eine Kreditkarte benötigt? | 1 |
| 39 | Wie sieht die Kündigungsregelung aus, und gibt es eine Mindestvertragslaufzeit? | 1 |
| 40 | Gibt es bei einer jährlichen Zahlung einen ausgewiesenen Rabatt, oder wird das im Einzelfall verhandelt? | 1 |
So liest du deine Ergebnisse
Ein Wert über 85 ohne Red Flags bei Sicherheit oder Messqualität ist ein starker Kandidat. Ein Wert zwischen 65 und 84 ist brauchbar, wenn du die spezifischen Lücken eines Anbieters wegverhandeln kannst. Unter 65 deutet auf Probleme in mehreren Kategorien hin, nicht nur in einem schwachen Bereich.
Behandle Kategorie 6 anders als die übrigen. Ein ungelöster Red Flag bei der Sicherheit sollte einen Anbieter unabhängig von der Gesamtpunktzahl disqualifizieren, denn eine Lücke bei der Daten-Governance gleicht sich nicht durch eine starke Prompt-Methodik aus.
Die Standardgewichtung oben passt für einen allgemeinen Käufer. Eine Agentur, die mehrere Kundenkonten betreut, sollte Reporting und Integrationen höher gewichten. Ein Team mit Einkauf und Rechtsabteilung am Tisch sollte Sicherheit und Governance höher gewichten, bevor die RFP rausgeht, nicht erst, wenn die Antworten eintreffen. Dieselbe Logik der gewichteten Kategorien treibt auch die Bewertung hinter unserem Tool-Ranking an, vollständig dokumentiert auf der Seite Methodik.
Dein Bewertungsbogen
Kopiere diese Tabelle in eine Tabellenkalkulation, füge eine Spalte pro Anbieter hinzu, und trage die Kategoriesummen ein, sobald die Antworten eintreffen.
| Kategorie | Max. Punkte | Anbieter A | Anbieter B | Anbieter C |
|---|---|---|---|---|
| 1. Engine-Abdeckung und Datenaktualität | 20 | |||
| 2. Prompt-Methodik und -Herkunft | 15 | |||
| 3. Metriken und Messqualität | 15 | |||
| 4. Handlungs- und Umsetzungsfähigkeit | 15 | |||
| 5. Reporting und Integrationen | 10 | |||
| 6. Sicherheit, Compliance und Governance | 10 | |||
| 7. Support und Onboarding | 10 | |||
| 8. Preise und Vertragsbedingungen | 5 | |||
| Gesamt | 100 |
Wende das auf deine eigene Shortlist an
Drucke die acht Tabellen oben aus, schick sie an jeden Anbieter auf deiner Liste, und bewerte die Antworten für jeden auf dieselbe Weise. Die Scorecard funktioniert nur, wenn du sie konsequent anwendest. Widersteh also dem Drang, bei dem Anbieter, den du schon favorisierst, eine Kategorie auszulassen.
Wenn du eine schnelle Baseline willst, bevor die RFP überhaupt rausgeht: Temso deckt die Kategorien Engine, Prompt und Handlung in einem einzigen Tarif für 89 €/Monat ab, mit kostenloser Testphase und ohne Kreditkarte. So hat dein Gremium eine funktionierende Referenz, mit der es jede andere Antwort vergleichen kann.
Was du als Nächstes lesen solltest
- Vollständiges Tool-Ranking: /rankings/ai-visibility-tools
- Bewertungsmethodik: /methodology
- Wichtige Begriffe erklärt: /glossary
- Temso-Tool-Profil: /tools/temso
- Profound-Tool-Profil: /tools/profound
- Peec-AI-Tool-Profil: /tools/peec-ai