AI Visibility Software
← Blog
Veröffentlicht

Die Bewertungs-Scorecard für AI-Visibility-Software: 40 RFP-Fragen mit Gewichtung (kostenlose Vorlage)

Eine neutrale, gewichtete RFP-Scorecard für AI-Visibility-Software: 40 Fragen in acht Kategorien, mit Punktwerten und Red-Flag-Antworten, auf die du achten solltest.

Kurz gesagt

Bewerte RFPs für AI-Visibility-Software anhand von acht gewichteten Kategorien: Engine-Abdeckung, Prompt-Methodik, Messqualität, Handlungsfähigkeit, Reporting, Sicherheit, Support und Preise. Arbeite die 40 Fragen unten durch, gewichte jede Kategorie mit fünf bis 20 Punkten, und disqualifiziere jeden Anbieter, dessen Antwort einen gelisteten Red Flag auslöst.

Zuletzt aktualisiert im Oktober 2026. Preise, Tarifstruktur und Anbieterfunktionen unten entsprechen dem Stand der veröffentlichten Anbieter-Websites zum Zeitpunkt der Erstellung.

Die meisten Scorecards für Anbieter schreibt das Vertriebsteam des Anbieters selbst, und man merkt es. Die Fragen bevorzugen das, was dieser Anbieter bereits gut kann, und lassen die Kategorien aus, in denen ein Wettbewerber gewinnen würde. Eine G2-Studie zur „Answer Economy” aus dem Jahr 2026 ergab: 51 % der B2B-Softwarekäufer starten ihre Kaufrecherche inzwischen in einem KI-Chatbot, gegenüber 29 % ein Jahr zuvor. Das macht die Software, die diesen Kanal misst, zu einer echten Einkaufsentscheidung und nicht zu einem Nebenkauf.

Diese Scorecard ist anbieterneutral. Sie stellt jeder Plattform auf deiner Shortlist dieselben 40 Fragen, gewichtet die Antworten auf die gleiche Weise und markiert die Antworten, die einen Käufer unabhängig vom Anbieter beunruhigen sollten. Nutze sie so, wie sie ist, oder passe die Kategorie-Gewichtung an die Prioritäten deines Teams an, bevor du sie verschickst.

So verwendest du diese Scorecard

Schicke die acht Kategorietabellen unten an jeden Anbieter auf deiner Shortlist, oder geh sie gemeinsam in einer Live-Demo durch. Vergib für jede Frage die volle Punktzahl bei einer starken, belegten Antwort, die halbe Punktzahl bei einer vagen oder unvollständigen Antwort und null Punkte bei einem Red Flag.

Addiere die Punkte innerhalb jeder Kategorie und anschließend die acht Kategoriesummen zu einem Gesamtwert von 100 Punkten. Ein Anbieter, der eine Frage gar nicht beantworten kann, bekommt dafür null Punkte, genau wie bei einem Red Flag.

Auf einen Blick: die 8 Kategorien

KategorieGewichtungWas sie prüft
Engine-Abdeckung und Datenaktualität20Welche Engines sie abdeckt und wie aktuell die Daten sind
Prompt-Methodik und -Herkunft15Woher die Prompts stammen und wie transparent der Nachweis ist
Metriken und Messqualität15Ob die Zahlen einer genauen Prüfung standhalten
Handlungs- und Umsetzungsfähigkeit15Ob sie Lösungen liefert oder nur Lücken aufzeigt
Reporting und Integrationen10Ob die Daten in den Tools ankommen, die dein Team bereits nutzt
Sicherheit, Compliance und Governance10Ob Einkauf und Rechtsabteilung zustimmen können
Support und Onboarding10Wie schnell du zu einem nutzbaren ersten Ergebnis kommst
Preise und Vertragsbedingungen5Ob die tatsächlichen Kosten sichtbar sind, bevor du unterschreibst

Für einen ausführlicheren Vergleich von Preisen und Engine-Abdeckung über die RFP-Fragen hinaus, sieh dir das vollständige Tool-Ranking an.

Kategorie 1: Engine-Abdeckung und Datenaktualität (20 Punkte)

Diese Kategorie hat das höchste Gewicht, weil eine Lücke in der Überwachung hier jede andere Kennzahl auf der Scorecard untergräbt. Eine Plattform, die ChatGPT verfolgt, aber Google AI Overviews auslässt, beantwortet nur die Hälfte der Frage deiner Käuferinnen. Profound deckt in seinem Growth-Tarif neun oder mehr Engines ab und rechnet diese Tiefe in den Preis ein. Peec AI startet schlank mit drei Modellen und berechnet zusätzliche Engines als Add-ons. Verlange von jedem Anbieter, beides zu zeigen, nicht nur zu beschreiben.

#FragePunkte
1Welche KI-Engines verfolgt die Plattform heute, und ist Google AI Overviews standardmäßig enthalten oder nur als Add-on erhältlich?4
2Wie oft werden die Daten für jede verfolgte Engine aktualisiert, und ändert sich die Aktualisierungsgeschwindigkeit je nach Tarif?4
3Werden Google AI Overviews und Gemini als separate, klar gekennzeichnete Flächen verfolgt?4
4Was passiert mit historischen Trenddaten, wenn der Anbieter eine Engine hinzufügt oder entfernt?4
5Können wir eine neue Engine zu einem bestehenden Prompt-Set hinzufügen, ohne das komplette Onboarding zu wiederholen?4

Kategorie 2: Prompt-Methodik und -Herkunft (15 Punkte)

Zwei Anbieter können exakt denselben Share-of-Voice-Wert aus zwei völlig unterschiedlichen Prompt-Sets melden, und nur eines dieser Sets spiegelt wider, wie deine Käuferinnen tatsächlich suchen. Ahrefs Brand Radar baut sein Prompt-Korpus aus einer Datenbank mit mehr als 405 Millionen echten Suchanfragen auf, erhoben über sechs KI-Plattformen hinweg. Das AI Visibility Toolkit von Semrush entdeckt Prompts automatisch aus dem Keyword-Universum, das bereits in deinem Semrush-Konto vorhanden ist. Keiner der beiden Ansätze ist falsch, aber sie erzeugen unterschiedliche Prompt-Sets. Deine RFP sollte jeden Anbieter dazu zwingen, vor dem Vertragsabschluss zu benennen, welches Set du kaufst.

#FragePunkte
6Stammen die Prompts aus echten Such- oder Chat-Anfragedaten, werden sie manuell vom Käufer geschrieben, oder werden sie automatisch aus einer bestehenden Keyword-Liste ermittelt?3
7Wie viele Prompt-Varianten pro Intention verfolgt die Plattform standardmäßig, und gibt es im Basistarif eine feste Obergrenze?3
8Zeigt die Plattform den exakten Prompt-Text und die Engine-Antwort hinter einer bewerteten Zitation, oder nur einen aggregierten Prozentwert?3
9Wie geht die Plattform mit Prompt-Drift um, also damit, Prompts auszusortieren, die nicht mehr widerspiegeln, wie Käufer die Frage formulieren?3
10Sind Prompt-Daten auf Wettbewerbsebene in derselben Oberfläche sichtbar, oder nur die Ergebnisse der eigenen Marke?3

Kategorie 3: Metriken und Messqualität (15 Punkte)

Ein Dashboard, das auf einem einzigen Durchlauf basiert, meldet Rauschen, kein Signal, denn Answer Engines sind probabilistisch, und eine einzelne Antwort ist nur eine Stichprobe aus einer Verteilung. Diese Kategorie prüft, ob die Zahlen des Anbieters ein internes Audit überstehen würden, bevor dein Team sie nach oben präsentiert.

#FragePunkte
11Meldet die Plattform Share of Voice, Markenerwähnungen, Citation Rate und Sentiment als 4 getrennte Kennzahlen, oder fasst sie diese zu einem einzigen Wert zusammen?3
12Wie viele Durchläufe pro Prompt erhebt die Plattform, bevor sie einen Prozentwert meldet?3
13Können wir Rohdaten auf Prompt-Ebene exportieren, oder nur die aggregierte Dashboard-Ansicht?3
14Unterscheidet die Sentiment-Bewertung zwischen positiv, neutral und negativ, oder liefert sie nur ein binäres Ergebnis?3
15Wie kennzeichnet die Plattform sachliche Fehler über unsere Marke, getrennt vom Sentiment?3

Kategorie 4: Handlungs- und Umsetzungsfähigkeit (15 Punkte)

Die meisten Plattformen hören beim Dashboard auf: Sie zeigen dir die Lücke und übergeben die Lösung an dein Team. Temso schließt diese Lücke ab 89 €/Monat. Das Dashboard verwandelt eine Sichtbarkeitslücke innerhalb desselben Abos in eine priorisierte Lösungsliste und einen Content-Brief, und der AI-SEO-Agent kann einen Teil dieser Empfehlungen direkt umsetzen, mit einem menschlichen Prüfschritt, bevor irgendetwas veröffentlicht wird. Frag jeden Anbieter, ob „Handlung” eine generische Checkliste bedeutet oder eine Lösung, die an deine tatsächliche Lücke gekoppelt ist.

#FragePunkte
16Wenn die Plattform eine Sichtbarkeitslücke findet, liefert sie eine priorisierte, gerankte Lösung, oder bleibt sie beim Dashboard stehen?3
17Kann die Plattform ein Content-Briefing oder einen Entwurf erstellen, der an einen bestimmten Prompt gekoppelt ist, bei dem ein Wettbewerber vorn liegt?3
18Behebt die Plattform Zitationslücken bei Drittquellen, oder gibt sie nur Empfehlungen für eigene Inhalte?3
19Automatisiert die Plattform einen Teil der Umsetzung, und was genau passiert ohne menschliche Prüfung?3
20Wie bestätigt die Plattform, ob eine umgesetzte Lösung die Lücke in den folgenden Wochen tatsächlich geschlossen hat?3

Kategorie 5: Reporting und Integrationen (10 Punkte)

Daten, die nur im Dashboard eines Anbieters existieren, erreichen selten die Menschen, die danach handeln müssen. Diese Kategorie prüft, ob die Plattform Belege in die Tools schiebt, die dein Team bereits einsetzt. Peec AI liefert zum Beispiel native Konnektoren zu Slack und BI-Tools, statt Export und Import als Hausaufgabe für die Analystin zu belassen.

#FragePunkte
21Können Reports geplant und als PDF, CSV oder per API exportiert werden, ohne manuelles Kopieren und Einfügen?2
22Lässt sich die Plattform mit Tools integrieren, die du bereits nutzt, etwa Slack, ein BI-Tool oder GA4?2
23Kannst du eine separate Dashboard-Ansicht für eine Management-Zusammenfassung im Gegensatz zu Detailtiefe auf Analystenebene erstellen?2
24Ist eine öffentliche API im Basispreis enthalten, oder nur gegen ein kostenpflichtiges Add-on verfügbar?2
25Können mehrere Marken oder Properties von einem Konto aus verwaltet werden, ohne doppelte Logins?2

Kategorie 6: Sicherheit, Compliance und Governance (10 Punkte)

Das ist die Kategorie, die einen Deal komplett stoppen kann, nicht nur Punkte kostet. Hol dir jede Antwort hier schriftlich, bevor der Vertrag unterschrieben wird, nicht erst während des Onboardings.

#FragePunkte
26Ist der Anbieter SOC-2-Type-II-zertifiziert, und kann er den Bericht auf Anfrage vorlegen?2
27Unterstützt die Plattform SSO und rollenbasierte Zugriffskontrolle?2
28Wo werden Kundendaten gehostet, und gibt es eine dokumentierte Richtlinie zu Aufbewahrung und Löschung?2
29Enthält der Vertrag eine Auftragsverarbeitungsvereinbarung, die die DSGVO-Anforderungen abdeckt?2
30Wem gehören das Prompt-Set und die historischen Daten nach einer Kündigung, und können wir vorher alles exportieren?2

Kategorie 7: Support und Onboarding (10 Punkte)

Ein Tool mit perfekten Daten ist wertlos, wenn dein Team nie über die Einrichtung hinauskommt. In dieser Kategorie verlieren Budget-Plattformen am häufigsten Punkte, da dedizierter Support meist den höheren Tarifen vorbehalten ist.

#FragePunkte
31Wie sieht das Onboarding am ersten Tag aus: eine geführte Einrichtung, eine feste Ansprechperson, oder ein Self-Service-Assistent ohne menschlichen Kontakt?2
32Wie lange dauert es im Durchschnitt von der Anmeldung bis zu einem nutzbaren ersten Dashboard?2
33Ist Kundensupport in jedem Tarif enthalten, oder nur in den teureren Plänen?2
34Bietet der Anbieter Schulungen oder Dokumentation für ein Team ohne dedizierte AEO-Analystin?2
35Welchen Prozess hat der Anbieter, um eine Erwähnung oder einen Sentiment-Wert anzufechten, den du für falsch hältst?2

Kategorie 8: Preise und Vertragsbedingungen (5 Punkte)

Die tatsächlichen Kosten einer AI-Visibility-Plattform stehen selten auf der Preisseite. Der Starter-Tarif von Profound deckt für 99 €/Monat nur ChatGPT ab, echte Abdeckung gibt es erst im Growth-Tarif für 399 €/Monat. Das AI Visibility Toolkit von Semrush ist ein Add-on für 99 €/Monat, das einen kostenpflichtigen Semrush-Pro-Tarif ab 139,95 €/Monat voraussetzt, bevor es sich aktivieren lässt. Der Starter-Tarif von Peec AI kostet 85 €/Monat, mit zusätzlichen Engines als Add-ons für jeweils 30 bis 140 €/Monat. Temso hat drei feste Tarife, 89 €, 199 € und 499 € pro Monat, mit unbegrenzten Projekten, Nutzern und Empfehlungen in jedem davon, plus 15 % Rabatt bei jährlicher Zahlung.

#FragePunkte
36Sind die Preise veröffentlicht, oder erfordert jedes Angebot ein Vertriebsgespräch?1
37Werden Engines, Nutzer oder Prompt-Volumen als kostenpflichtige Add-ons abgerechnet, oder sind sie im Basispreis enthalten?1
38Gibt es eine kostenlose Testphase oder Pilotperiode, und wird dafür eine Kreditkarte benötigt?1
39Wie sieht die Kündigungsregelung aus, und gibt es eine Mindestvertragslaufzeit?1
40Gibt es bei einer jährlichen Zahlung einen ausgewiesenen Rabatt, oder wird das im Einzelfall verhandelt?1

So liest du deine Ergebnisse

Ein Wert über 85 ohne Red Flags bei Sicherheit oder Messqualität ist ein starker Kandidat. Ein Wert zwischen 65 und 84 ist brauchbar, wenn du die spezifischen Lücken eines Anbieters wegverhandeln kannst. Unter 65 deutet auf Probleme in mehreren Kategorien hin, nicht nur in einem schwachen Bereich.

Behandle Kategorie 6 anders als die übrigen. Ein ungelöster Red Flag bei der Sicherheit sollte einen Anbieter unabhängig von der Gesamtpunktzahl disqualifizieren, denn eine Lücke bei der Daten-Governance gleicht sich nicht durch eine starke Prompt-Methodik aus.

Die Standardgewichtung oben passt für einen allgemeinen Käufer. Eine Agentur, die mehrere Kundenkonten betreut, sollte Reporting und Integrationen höher gewichten. Ein Team mit Einkauf und Rechtsabteilung am Tisch sollte Sicherheit und Governance höher gewichten, bevor die RFP rausgeht, nicht erst, wenn die Antworten eintreffen. Dieselbe Logik der gewichteten Kategorien treibt auch die Bewertung hinter unserem Tool-Ranking an, vollständig dokumentiert auf der Seite Methodik.

Dein Bewertungsbogen

Kopiere diese Tabelle in eine Tabellenkalkulation, füge eine Spalte pro Anbieter hinzu, und trage die Kategoriesummen ein, sobald die Antworten eintreffen.

KategorieMax. PunkteAnbieter AAnbieter BAnbieter C
1. Engine-Abdeckung und Datenaktualität20
2. Prompt-Methodik und -Herkunft15
3. Metriken und Messqualität15
4. Handlungs- und Umsetzungsfähigkeit15
5. Reporting und Integrationen10
6. Sicherheit, Compliance und Governance10
7. Support und Onboarding10
8. Preise und Vertragsbedingungen5
Gesamt100

Wende das auf deine eigene Shortlist an

Drucke die acht Tabellen oben aus, schick sie an jeden Anbieter auf deiner Liste, und bewerte die Antworten für jeden auf dieselbe Weise. Die Scorecard funktioniert nur, wenn du sie konsequent anwendest. Widersteh also dem Drang, bei dem Anbieter, den du schon favorisierst, eine Kategorie auszulassen.

Wenn du eine schnelle Baseline willst, bevor die RFP überhaupt rausgeht: Temso deckt die Kategorien Engine, Prompt und Handlung in einem einzigen Tarif für 89 €/Monat ab, mit kostenloser Testphase und ohne Kreditkarte. So hat dein Gremium eine funktionierende Referenz, mit der es jede andere Antwort vergleichen kann.

Was du als Nächstes lesen solltest

FAQ

Was sollte eine RFP für AI-Visibility-Software abdecken?

Eine vollständige RFP für AI-Visibility-Software deckt acht Bereiche ab: welche KI-Engines die Plattform verfolgt und wie aktuell diese Daten sind, wie sie Prompts beschafft und verwaltet, wie belastbar ihre Kennzahlen sind, ob sie Lösungen liefert oder nur ein Dashboard zeigt, ihr Reporting und ihre Integrationen, ihre Sicherheit und Daten-Governance, ihr Onboarding und ihren Support sowie ihre Preise und Vertragsbedingungen. Engine-Abdeckung und Messqualität am stärksten zu gewichten spiegelt wider, wo sich Anbieter am meisten unterscheiden.

Wie viele Fragen sollte ich AI-Visibility-Anbietern stellen?

Vierzig Fragen in acht Kategorien, fünf Fragen pro Kategorie, reichen aus, um ernsthafte Plattformen von dünnen zu trennen, ohne die Beschaffung zu einem mehrwöchigen Projekt zu machen. Weniger als 20 Fragen übersehen zu viele Fehlerquellen, mehr als 50 verlangsamen das Einkaufsgremium, ohne viel zusätzliche Aussagekraft zu bringen.

Was gilt als Red Flag in der Antwort auf eine AI-Visibility-RFP?

Ein Red Flag ist jede Antwort, die die wahren Kosten oder eine Fähigkeitslücke bis nach der Anmeldung verbirgt: ein Anbieter, der den exakten Prompt und die Antwort hinter einem bewerteten Prozentwert nicht zeigen kann, eine Aktualisierungsrate, die langsamer als wöchentlich ist, ohne schnelleren Tarif, Preise pro Engine als Add-on, die erst nach der Demo offengelegt werden, oder kein SOC-2-Bericht und kein Zeitplan, einen zu bekommen. Ein einziger Red Flag in Kategorie 6 (Sicherheit) sollte den Prozess komplett stoppen.

Wie gewichte ich die Scorecard-Kategorien für mein Team?

Die Standardgewichtung (20, 15, 15, 15, 10, 10, 10 und 5 Punkte) passt für einen allgemeinen Käufer. Eine Agentur, die mehrere Kundenkonten betreut, sollte Reporting und Integrationen höher gewichten. Ein Enterprise-Team mit Einkauf und Rechtsabteilung am Tisch sollte Sicherheit und Governance höher gewichten. Passe die Gewichtung an, bevor du die RFP verschickst, nicht erst, wenn die Antworten der Anbieter eintreffen.

Ab welcher Gesamtpunktzahl sollte ein Anbieter ausscheiden?

Unter 65 von 100 Punkten deutet auf echte Lücken in mehreren Kategorien hin, nicht nur in einem schwachen Bereich. Zwischen 65 und 84 Punkten ist brauchbar, wenn du die spezifischen Lücken wegverhandeln kannst. Über 85 Punkte ohne Red Flags bei Sicherheit oder Messqualität ist ein starker Kandidat. Jeder ungelöste Red Flag in der Kategorie Sicherheit und Governance sollte einen Anbieter unabhängig von der Gesamtpunktzahl disqualifizieren.

Beziehen Ahrefs Brand Radar und Semrush ihre Prompts auf die gleiche Weise?

Nein. Ahrefs Brand Radar baut sein Prompt-Korpus aus einer Datenbank mit mehr als 405 Millionen echten Suchanfragen auf, erhoben über sechs KI-Plattformen hinweg. Das AI Visibility Toolkit von Semrush entdeckt Prompts automatisch aus dem Keyword-Universum, das bereits im Semrush-Konto eines Kunden vorhanden ist. Beide sind legitime Ausgangspunkte, aber sie erzeugen unterschiedliche Prompt-Sets, und eine RFP-Antwort sollte benennen, welches Set ein Käufer bekommt.