Wenn die Meinung der ranghöchsten Person im Raum schwerer wiegt als alles, was auf dem Tisch liegt – und warum das kein Gehorsamsproblem ist
HIPPO steht für Highest Paid Person's Opinion, die Meinung der bestbezahlten Person im Raum. Der Begriff kommt aus der Welt der Onlineexperimente und beschreibt einen Vorgang, den jeder aus Besprechungen kennt: Es liegen Zahlen auf dem Tisch, es gibt drei Vorschläge, und dann sagt jemand mit dem größten Namensschild einen Satz, nach dem die Diskussion vorbei ist. Das Interessante daran ist, dass dabei niemand gehorcht und niemand Angst hat. Es ist eine Abkürzung, und sie fühlt sich für alle Beteiligten vernünftig an.
Dienstag, 9:20 Uhr, Leitungsrunde
Die Auswertung der letzten acht Wochen liegt ausgedruckt auf dem Tisch. Der Frühstückspreis wurde testweise angehoben, die Gästebewertungen sind stabil geblieben, die Stornoquote unverändert. Die Empfangsleitung hat die Zahlen aufbereitet und trägt sie vor.
Nach vier Minuten sagt der Inhaber: „Ich glaub das nicht. Die Leute merken das, und irgendwann kommen sie nicht wieder.“
Was danach passiert, ist bemerkenswert. Niemand widerspricht. Niemand fragt, worauf sich diese Einschätzung stützt. Die Empfangsleitung sagt „Gut, dann nehmen wir ihn zurück“ und legt die Auswertung weg.
Und alle im Raum haben das Gefühl, dass hier gerade eine vernünftige Entscheidung getroffen wurde. Das ist der Punkt, um den es geht: Der Vorgang sieht von innen nicht aus wie ein Fehler.
Woher der Begriff kommt
Die Herkunft ist ungewöhnlich gut dokumentiert, weil die Beteiligten sie selbst aufgeschrieben haben. Dylan Lewis bei Intuit prägte 2006 die Abkürzung HiPO für Highest Paid Opinion. Im August desselben Jahres erwähnte Avinash Kaushik den Ausdruck gegenüber Ronny Kohavi, der ihn für Microsoft zu HiPPO abwandelte, weil HiPO dort intern bereits für High Potential stand. Kaushik schrieb im Oktober 2006 darüber.
In die Fachliteratur kam der Begriff 2007 über eine begutachtete Arbeit auf der KDD-Konferenz mit einem Titel, der das Programm gleich mitliefert: „Practical Guide to Controlled Experiments on the Web: Listen to Your Customers not to the HiPPO“.
Das ist wichtig für die Einordnung. Der Begriff stammt nicht aus der Führungspsychologie, sondern aus der Praxis von Unternehmen, die ihre Annahmen millionenfach überprüfen konnten. Er ist keine Theorie, sondern eine Beobachtung von Leuten, die den Vergleich zwischen Meinung und Messung ständig vor Augen hatten.
Warum eine Meinung so viel Gewicht bekommt, obwohl sie nur eine Meinung ist
Die naheliegende Erklärung wäre Angst. Die trifft in manchen Häusern zu, erklärt aber nicht die Fälle, in denen das Klima gut ist und trotzdem niemand nachfragt.
Eine bessere Erklärung liefern Cameron Anderson und Gavin Kilduff, die 2009 im Journal of Personality and Social Psychology untersucht haben, warum dominant auftretende Menschen in Gruppen Einfluss gewinnen. Ihr Befund: Sie verhalten sich so, dass sie kompetent wirken – auch dann, wenn sie es in der Sache nicht sind.
Die Zahlen aus ihrer zweiten Studie mit 100 Personen an standardisierten Mathematikaufgaben sind eindeutig. Dominanz hing weder mit den Mathematikwerten aus dem Aufnahmetest nennenswert zusammen (r = 0,18, nicht signifikant) noch mit der Richtigkeit der tatsächlichen Antworten (r = 0,06, nicht signifikant). Als kompetenter wahrgenommen wurden diese Personen trotzdem.
Übertragen auf eine Leitungsrunde heißt das: Wer schnell antwortet, ohne zu zögern formuliert und keine einschränkenden Nebensätze verwendet, wirkt sachkundiger. Ob er es ist, entscheidet sich an anderer Stelle. Und Rang verstärkt diesen Eindruck zusätzlich, weil er als Beleg dafür gelesen wird, dass frühere Einschätzungen offenbar gestimmt haben.
Der eigentliche Schaden liegt nicht in der Entscheidung, sondern im Informationsfluss
Hier wird es für Betriebe unangenehm. Denn das Problem ist nicht die eine falsche Entscheidung. Es ist das, was danach nicht mehr gesagt wird.
Garold Stasser und William Titus haben 1985 ein Experiment veröffentlicht, das dazu erstaunlich klar ist. Vierergruppen sollten aus mehreren Kandidaten den besten auswählen. Ein Kandidat war objektiv am besten geeignet. Entscheidend war, wie die Informationen verteilt wurden.
→ Hatten alle vier Personen sämtliche Informationen, wählten 83 Prozent der Gruppen den objektiv besten Kandidaten.
→ Waren die entscheidenden Informationen auf die Mitglieder verteilt, sodass jede Person nur einen Teil kannte, wählten je nach Bedingung nur noch 24 beziehungsweise 12 Prozent der Gruppen den besten Kandidaten.
Die Gruppen hatten zusammengenommen alles, was sie gebraucht hätten. Sie sprachen es nur nicht aus. Diskutiert wurde bevorzugt das, was ohnehin alle wussten und was die von Anfang an beliebteste Option stützte.
Genau das passiert nach einem HIPPO-Satz, nur schneller. Sobald die Richtung feststeht, ist Information, die nur einer Person vorliegt, nicht mehr gefragt. Sie geht nicht verloren, weil jemand sie unterdrückt, sondern weil sie nicht mehr relevant erscheint.
Für ein Haus heißt das: Der Stornogrund, den nur die Reservierung kennt, die Rückmeldung, die nur der Frühdienst gehört hat, die Beobachtung, die nur der Haustechniker gemacht hat – all das erreicht die Entscheidung nicht mehr.
Wie oft eine gute Idee tatsächlich funktioniert
Der stärkste Einwand gegen HIPPO-Entscheidungen ist nicht moralisch, sondern statistisch. Ronny Kohavi hat in seinem Vortrag zur KDD-Konferenz 2015 zusammengefasst, was zwölf Jahre Onlineexperimente bei Microsoft ergeben haben.
Von den getesteten Ideen waren rund ein Drittel positiv und statistisch bedeutsam, rund ein Drittel ohne messbaren Unterschied und rund ein Drittel sogar negativ. Bei Bing lag die Erfolgsquote nach seiner Angabe noch niedriger.
Zur Redlichkeit gehört die Einschränkung: Das sind Produktänderungen an Websites, keine Entscheidungen in einem Hotelbetrieb, und es sind Ideen, die es überhaupt bis zum Test geschafft haben. Die Zahl ist eine Richtungsangabe und kein Erwartungswert für Ihr Haus.
Die Richtung genügt aber für den entscheidenden Gedanken. Wenn schon Ideen von Fachleuten in einem gut vermessenen Umfeld nur in etwa einem von drei Fällen das tun, was sie sollen – wie hoch soll dann die Trefferquote einer Einschätzung sein, die in vier Minuten und ohne Zahlen entsteht?
Der Punkt ist ausdrücklich nicht, dass die ranghöchste Person häufiger falsch liegt als andere. Der Punkt ist, dass niemand eine Trefferquote hat, die es rechtfertigt, eine vorliegende Auswertung ohne Prüfung beiseitezulegen.
Was datenbasierte Entscheidungen tatsächlich bringen
Erik Brynjolfsson, Lorin Hitt und Heekyung Kim haben 2011 in einer viel zitierten Arbeit 179 große börsennotierte Unternehmen untersucht und danach unterschieden, wie stark Entscheidungen dort auf Daten und Auswertungen gestützt wurden.
Unternehmen mit stärker datengestützter Entscheidungsfindung wiesen eine um 5 bis 6 Prozent höhere Produktivität und Ausbringung auf, als angesichts ihrer sonstigen Investitionen und ihres Technikeinsatzes zu erwarten gewesen wäre.
Die Autoren gehen mit der Ursachenfrage vorsichtig um und setzen ein Instrumentvariablen-Verfahren ein, um auszuschließen, dass die Wirkungsrichtung umgekehrt verläuft. Ein Arbeitspapier über Großunternehmen ist trotzdem kein Beleg dafür, dass ein Hotel mit vierzig Zimmern durch mehr Auswertungen 5 Prozent gewinnt.
Was die Zahl leistet, ist eine Größeneinordnung. Der Unterschied zwischen einem Betrieb, der nach Meinung entscheidet, und einem, der nach Prüfung entscheidet, liegt nicht im Bereich weicher Faktoren. Er ist in derselben Größenordnung wie Dinge, für die Häuser erhebliche Anstrengungen unternehmen.
Sechs Anzeichen im Hausalltag
→ Auswertungen werden vorgetragen, aber nicht besprochen. Es gibt Zahlen und danach eine Einschätzung, und die Einschätzung setzt sich durch, ohne dass beide gegeneinander gehalten wurden.
→ Die Reihenfolge in Besprechungen ist immer dieselbe: Die ranghöchste Person spricht zuerst, alle anderen danach.
→ Widerspruch kommt nur unter vier Augen und nach der Runde, auf dem Flur oder in der Küche.
→ Entscheidungen lassen sich im Nachhinein nicht begründen, sondern nur zuordnen: Man weiß, wer sie getroffen hat, aber nicht, worauf sie sich stützte.
→ Auf die Frage, woran man merken würde, dass die Entscheidung falsch war, gibt es keine Antwort. Es wurde kein Kriterium vereinbart.
→ Wer eine Auswertung vorbereitet, fragt vorher, welches Ergebnis erwünscht ist. Das ist der Punkt, an dem der Effekt sich verselbstständigt hat.
Das ist nicht dasselbe wie Autorität, Konformität oder Gruppendenken
Vier verwandte Themen dieser Reihe werden hier regelmäßig verwechselt, und die Unterschiede sind praktisch bedeutsam, weil sie zu unterschiedlichen Gegenmaßnahmen führen.
Der Autoritätseffekt beschreibt Gehorsam gegenüber einer als legitim empfundenen Hierarchie. Dort wird eine Anweisung befolgt. Beim HIPPO-Effekt gibt es keine Anweisung. Es wird eine Meinung geäußert, und alle behandeln sie wie ein Ergebnis.
Konformität nach Asch ist Anpassung an eine Mehrheit. Der HIPPO-Effekt braucht keine Mehrheit. Eine einzige Person genügt, und die übrigen können anderer Auffassung sein, ohne dass es etwas ändert.
Gruppendenken beschreibt eine Runde, die gemeinsam von einer schlechten Entscheidung überzeugt ist. Beim HIPPO-Effekt sind die anderen häufig gerade nicht überzeugt. Sie sagen es nur nicht mehr, weil die Frage entschieden wirkt.
Und der soziale Beweis wirkt in Situationen echter Unklarheit, in denen man sich mangels eigener Anhaltspunkte an anderen orientiert. Der HIPPO-Effekt tritt gerade dann auf, wenn Anhaltspunkte vorliegen. Die Auswertung liegt ja auf dem Tisch.
Auch zur psychologischen Sicherheit gibt es einen Unterschied, der leicht übersehen wird. Ein Team mit geringer Sicherheit schweigt aus Sorge vor Folgen. Der HIPPO-Effekt tritt auch in Teams auf, die sich sehr wohl trauen zu widersprechen – weil hier nicht Widerspruch fehlt, sondern ein Verfahren, das der Meinung und der Auswertung unterschiedliches Gewicht zuweist.
Sechs Werkzeuge, die im Alltag funktionieren
→ Zuletzt sprechen. Wer die Runde leitet, äußert seine Einschätzung als Letzter. Das ist die billigste Führungsentscheidung überhaupt und die wirksamste in dieser Liste. Wer zuerst spricht, entscheidet, worüber gesprochen wird.
→ Schriftlich vor mündlich. Vor der Diskussion schreibt jeder seine Einschätzung in zwei Sätzen auf. Michael Diehl und Wolfgang Stroebe haben 1987 gezeigt, dass Einzelpersonen, deren Beiträge anschließend zusammengelegt werden, fast doppelt so viele unterschiedliche Ideen hervorbringen wie dieselbe Zahl von Menschen in einer Gesprächsrunde. Der Hauptgrund ist banal: In einer Runde spricht immer nur einer.
→ Die Entscheidungsgrundlage vorher benennen. Vor der Diskussion festlegen, woran sich die Entscheidung bemisst. Das kostet zwei Minuten und macht den Unterschied zwischen einer Diskussion und einer Prüfung.
→ Die Widerlegungsfrage. „Woran würden wir in acht Wochen merken, dass diese Entscheidung falsch war?“ Wer darauf keine Antwort hat, hat keine Entscheidung getroffen, sondern eine Präferenz geäußert.
→ Der kleine Test statt der großen Meinung. Wo eine Meinung und eine Auswertung auseinandergehen, ist ein befristeter Versuch fast immer billiger als die Debatte. Zwei Wochen, ein vorher benanntes Kriterium, ein Termin.
→ Die Herkunftsfrage. Bei jeder Aussage in einer Runde einmal höflich nachfragen, worauf sie beruht – bei allen, ausdrücklich auch bei sich selbst. Als Gewohnheit eingeführt, ist das keine Konfrontation, sondern Protokoll.
Wann die ranghöchste Meinung tatsächlich die beste ist
Der Artikel wäre unehrlich, wenn er diesen Teil ausließe. Es gibt Lagen, in denen die Einschätzung der erfahrensten Person die tragfähigste ist, und sie sind nicht selten.
→ Bei echtem Zeitdruck. Wenn in zwanzig Minuten entschieden werden muss, ist eine erfahrene Einschätzung besser als ein abgebrochener Abstimmungsprozess.
→ Wenn keine Daten vorliegen. Der HIPPO-Effekt beschreibt das Übergehen vorhandener Belege. Wo keine da sind, ist Erfahrung die beste verfügbare Grundlage.
→ Bei Fragen, die der Haltung des Hauses gelten und nicht der Wirkung. Ob man eine bestimmte Veranstaltung annimmt, ist keine Optimierungsfrage.
→ Wenn die Person die Folgen trägt. Wer für ein Ergebnis geradesteht, darf bei Uneindeutigkeit entscheiden. Das ist keine Verzerrung, sondern Verantwortung.
Die Unterscheidung ist also nicht Meinung gegen Daten. Sie lautet: Liegt etwas vor, das die Frage beantworten könnte? Wenn ja, gehört es geprüft. Wenn nein, entscheidet die erfahrenste Einschätzung – und sollte auch genau so benannt werden.
Wann Erfahrung überhaupt in verlässliches Urteilsvermögen übergeht, ist eine eigene Frage. Sie wird im Artikel dieser Reihe zur Mustererkennung ausführlich behandelt.
Wie Sie merken, dass Sie selbst das Nilpferd sind
Der Effekt ist nach dem Menschen benannt, der ihn auslöst, und wird ausgerechnet von diesem am schlechtesten bemerkt. Vier Beobachtungen sind brauchbarer als jede Selbsteinschätzung.
→ Ihre Vorschläge werden auffallend selten hinterfragt, obwohl Ihre Trefferquote nicht auffallend hoch ist.
→ Diskussionen enden, kurz nachdem Sie gesprochen haben, und zwar unabhängig davon, wie gut Ihr Beitrag war.
→ Sie erfahren von Einwänden später und einzeln, meist beginnend mit „Ich wollte nur noch sagen …“.
→ In Auswertungen, die für Sie erstellt werden, steht auffällig oft das, was Sie erwartet haben.
Wenn zwei dieser vier Punkte zutreffen, ist die wirksamste Änderung nicht mehr Bescheidenheit, sondern eine andere Reihenfolge. Sprechen Sie in der nächsten Runde als Letzter und sagen Sie das zu Beginn ausdrücklich an. Was dabei sichtbar wird, ist beim ersten Mal unangenehm sichtbar.
Was in den ersten Wochen passiert
→ In der ersten Runde entsteht Stille. Wenn die ranghöchste Person nicht beginnt, weiß zunächst niemand, wer anfangen soll. Das ist normal und dauert etwa zwei Sitzungen.
→ Danach werden die Beiträge länger und vorsichtiger. Menschen, die es nicht gewohnt sind, als Erste zu sprechen, sichern sich sprachlich ab. Das legt sich.
→ Nach etwa vier Wochen kommt der kritische Moment: die erste Runde, in der die Mehrheitsmeinung der Leitung widerspricht. Wie diese eine Situation ausgeht, entscheidet über das ganze Vorhaben.
→ Nach etwa einem Quartal ändert sich die Vorbereitung. Auswertungen werden mit Einschränkungen vorgelegt statt mit Empfehlungen. Das ist ein gutes Zeichen und wirkt anfangs wie das Gegenteil.
Drei Einwände, die berechtigt sind
„Irgendwer muss entscheiden.“ Richtig, und daran ändert sich nichts. Es geht nicht darum, wer entscheidet, sondern wann. Zuletzt zu sprechen verschiebt keine Zuständigkeit, sondern nur den Zeitpunkt.
„Bei uns dauert alles schon lange genug.“ Zutreffend, wenn jede Frage zur Diskussion wird. Der Vorschlag hier ist umgekehrt: Zwei Minuten für die Entscheidungsgrundlage am Anfang sparen die zwanzig Minuten Grundsatzdebatte am Ende. Und die meisten Fragen brauchen ohnehin keine Runde.
„Meine Erfahrung ist doch etwas wert.“ Ohne Zweifel, und in den oben genannten Lagen ist sie die beste verfügbare Grundlage. Sie verliert ihren Wert nur an genau einer Stelle: wenn sie eine vorliegende Auswertung ersetzt, statt sie einzuordnen.
Fazit
Der HIPPO-Effekt ist keine Charakterfrage und kein Führungsfehler im üblichen Sinn. Er ist eine Abkürzung, die für alle Beteiligten im Moment vernünftig aussieht: Die erfahrenste Person hat eine klare Einschätzung, also spart man sich den Rest.
Teuer wird er nicht durch die einzelne Entscheidung, sondern durch das, was danach nicht mehr gesagt wird. Die Untersuchung von Stasser und Titus zeigt, wie viel eine Gruppe verliert, wenn Informationen nur bei einzelnen liegen und nicht ausgesprochen werden: 83 Prozent richtige Entscheidungen mit vollständiger Information, 24 und 12 Prozent ohne.
Und die Gegenmaßnahme ist so unspektakulär, dass sie leicht unterschätzt wird. Nicht mehr Bescheidenheit, nicht mehr Demut, nicht mehr Datenkultur. Eine andere Reihenfolge in der nächsten Besprechung, zwei Sätze vorher aufgeschrieben und eine Frage: Woran würden wir merken, dass wir uns geirrt haben?
Quellen und Anmerkungen
· Zur Herkunft des Begriffs: Dylan Lewis (Intuit) prägte 2006 die Abkürzung HiPO für Highest Paid Opinion. Avinash Kaushik erwähnte den Ausdruck im August 2006 gegenüber Ronny Kohavi, der ihn bei Microsoft zu HiPPO abwandelte, da HiPO dort bereits für High Potential stand; Kaushik veröffentlichte im Oktober 2006 dazu. Dokumentiert auf der Seite exp-platform.com der Beteiligten.
· Kohavi, R., Henne, R. M. & Sommerfield, D. (2007). Practical Guide to Controlled Experiments on the Web: Listen to Your Customers not to the HiPPO. Proceedings der 13. ACM SIGKDD International Conference on Knowledge Discovery and Data Mining. — Erste Verwendung des Begriffs in einer begutachteten Arbeit.
· Kohavi, R. (2015). Online Controlled Experiments: Lessons from Running A/B/n Tests for 12 Years. Hauptvortrag, KDD 2015. — Rund ein Drittel der getesteten Ideen positiv und statistisch bedeutsam, rund ein Drittel ohne messbaren Unterschied, rund ein Drittel negativ; bei Bing nach eigener Angabe niedrigere Erfolgsquote. Bezieht sich auf Produktänderungen an Websites, nicht auf betriebliche Entscheidungen im Gastgewerbe.
· Anderson, C. & Kilduff, G. J. (2009). Why do dominant personalities attain influence in face-to-face groups? The competence-signaling effects of trait dominance. Journal of Personality and Social Psychology, 96(2), 491–503. — Studie 2 mit 100 Personen an standardisierten Mathematikaufgaben: Dominanz hing weder mit den Testwerten (r = 0,18, nicht signifikant) noch mit der Richtigkeit der Antworten (r = 0,06, nicht signifikant) zusammen, wurde aber als Kompetenz wahrgenommen.
· Stasser, G. & Titus, W. (1985). Pooling of unshared information in group decision making: Biased information sampling during discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478. — Vierergruppen, Auswahl des objektiv am besten geeigneten Kandidaten: 83 Prozent bei vollständiger Information für alle, 24 beziehungsweise 12 Prozent bei auf die Mitglieder verteilter Information. Studierende im Labor, keine Betriebsstudie.
· Brynjolfsson, E., Hitt, L. M. & Kim, H. H. (2011). Strength in Numbers: How Does Data-Driven Decisionmaking Affect Firm Performance? SSRN Working Paper Nr. 1819486. — 179 große börsennotierte Unternehmen; stärker datengestützte Entscheidungsfindung ging mit 5 bis 6 Prozent höherer Produktivität und Ausbringung einher als aufgrund der sonstigen Investitionen und des Technikeinsatzes zu erwarten. Die Autoren setzen ein Instrumentvariablen-Verfahren ein, um umgekehrte Wirkungsrichtung auszuschließen. Arbeitspapier, Großunternehmen, nicht auf einzelne Hotelbetriebe übertragbar.
· Diehl, M. & Stroebe, W. (1987). Productivity loss in brainstorming groups: Toward the solution of a riddle. Journal of Personality and Social Psychology, 53(3), 497–509. — Getrennt arbeitende Einzelpersonen, deren Beiträge anschließend zusammengelegt werden, brachten nahezu doppelt so viele unterschiedliche Ideen hervor wie tatsächlich zusammensitzende Gruppen; als Hauptursache identifizierten die Autoren, dass in einer Runde immer nur eine Person gleichzeitig sprechen kann.
· Abgrenzung zu vier Vorthemen dieser Reihe: Autoritätseffekt (Gehorsam gegenüber legitimer Hierarchie, Milgram), Konformität (Anpassung an eine Mehrheit, Asch), Gruppendenken (gemeinsame Überzeugung einer Runde, Janis) und sozialer Beweis (Orientierung an anderen bei echter Unklarheit, Sherif und Cialdini). Der HIPPO-Effekt unterscheidet sich von allen vieren dadurch, dass Belege vorliegen und dennoch eine einzelne Einschätzung an ihre Stelle tritt.
· Als Praxisableitung und nicht als Studienergebnis gekennzeichnet: die sechs Anzeichen im Hausalltag, die vier Selbstbeobachtungen, die Widerlegungsfrage, der Vorschlag des befristeten Tests, der Verlauf über die ersten Wochen einschließlich der Vier-Wochen-Marke sowie die Aufzählung der Lagen, in denen die erfahrenste Einschätzung tragfähig ist.
· Anmerkung zur Übertragbarkeit: Anderson und Kilduff (2009), Stasser und Titus (1985) sowie Diehl und Stroebe (1987) sind Laborstudien mit Studierenden. Richtung und Größenordnung der Befunde sind übertragbar, einzelne Werte nicht als Erwartungswerte für eine Leitungsrunde zu lesen. Die Angaben von Kohavi stammen aus einem Konferenzvortrag der Praxis und nicht aus einer begutachteten Untersuchung.