Labor · 29. September 2026
Wie wir prüfen, dass die richtigen Menschen zuerst kommen
Sieben Musikerinnen und Musiker in unserem Testpool spielen Gitarre und singen, außerdem produzieren sie selbst. Den Job können alle sieben.
Wer sucht, schreibt kurze Nachrichten und will gleich beim ersten Anlauf fertige Arbeit. Nach diesem Maßstab kommt die Person, die am nächsten dran ist, auf fast doppelt so viele Punkte wie die Person, die am weitesten weg ist.
Folkso muss diese Person weit nach oben setzen. Wir prüfen das an 1.000 Suchen, deren richtige Antwort vorher feststeht, mit demselben Code, der dir in ChatGPT und Claude antwortet.
Was du bekommst
98 %
Die erste Person, die du siehst, kann das, was du gefragt hast.
96 %
Einer deiner drei besten Treffer steht schon unter den ersten drei.
93 %
Alle fünf Personen in den Ergebnissen können die Arbeit machen.
99 %
Wenn jemand passt, zeigt Folkso die Person.
Ein bester Treffer passt zur Aufgabe und zu deiner Arbeitsweise. Die Zahlen stammen vom 27. September 2026 und beruhen auf 300 Suchen, die bei der Abstimmung keine Rolle gespielt haben.
Wie wir so weit gekommen sind
Erste Person kann die Arbeit
- Zufällige Reihenfolge
- 21,4 %
- Vor dem 27. September
- 78,5 %
- Jetzt
- 98,1 %
Bester Treffer unter den ersten drei
- Zufällige Reihenfolge
- 11,3 %
- Vor dem 27. September
- 57,4 %
- Jetzt
- 76,4 %
Bester Treffer ganz oben
- Zufällige Reihenfolge
- 4,6 %
- Vor dem 27. September
- 28,5 %
- Jetzt
- 48,9 %
Passende Person wird gezeigt
- Vor dem 27. September
- 86,7 %
- Jetzt
- 99,0 %
Eine Änderung gilt nur dann als besser, wenn sie die alte Version um mehr als 5 Punkte übertrifft. So groß ist die Fehlerspanne bei 300 Suchen.
Warum du diesen Zahlen trauen kannst
- Der Testpool besteht aus 100 erfundenen Menschen und 250 erfundenen Suchenden. Jeder beginnt als verdeckte Karte. Darauf stehen Beruf, Stadt, Charakter, Werte und Geschmack.
- In jeder Nische gibt es Zwillinge. Das sind fünf oder mehr Menschen mit gleichen Fähigkeiten und unterschiedlichem Charakter, deshalb muss die Suche über die Berufsbezeichnung hinausschauen.
- Sprachmodelle haben die Profile und die 1.000 Suchen geschrieben, und zwar solche, wie ChatGPT und Claude sie an Folkso schicken.
- Die richtige Antwort ergibt sich aus den verdeckten Karten und zählt nur, was man im Profil lesen kann.
- 700 Suchen stimmen die Gewichte ab. Die anderen 300 werden zurückgehalten, und jede Zahl auf dieser Seite stammt aus ihnen.
- Jeder Durchlauf bleibt mit Datum und Code erhalten, dazu sein Ergebnis.
So läuft deine Suche ab
- Filter. Es bleiben nur Menschen, die für dein Anliegen offen sind und ein Budget in deiner Währung und Einheit haben. Wenn die Stadt wichtig ist, muss sie passen. Städtenamen funktionieren in jeder Sprache.
- Bedeutung. Folkso vergleicht deine Aufgabe mit jedem Profil nach Bedeutung und nach Wörtern und behält die 50 ähnlichsten.
- Lesen. Ein Modell liest diese 50 Profile vollständig, ohne Kontakte. Kann die Person die Arbeit machen? Sucht sie selbst nach derselben Rolle? Wie nah ist sie dir? Was habt ihr gemeinsam?
- Zweiter Blick. Die ersten sechs werden noch einmal gelesen, einzeln. Nur wer besteht, erreicht dich.
- Niemand passt. Folkso lockert die weichen Bedingungen und sagt dir, was sich geändert hat. Gibt es dann immer noch niemanden, sagt es dir das.
Deine Kontakte und die der anderen erreichen das Modell nie.
Was wir noch gemessen haben
- Keine Gründer im Weg. Gründer, die selbst eine React-Entwicklerin oder einen React-Entwickler brauchen, tauchen nicht auf, wenn du eine solche Person suchst. Mit dem Modell kam das 0 Mal in 565 Suchen vor.
- Jede Sprache. Ein Profil in einer anderen Sprache wird fast genauso gut gefunden. Der beste Treffer steht in 47,2 % der Suchen ganz oben, gegenüber 50,3 % in derselben Sprache.
- Tempo. Lesen und zweiter Blick verlängern die Suche im Median um 0,7 Sekunden.
- Streuung. Zwei identische Durchläufe des Modells weichen leicht voneinander ab, deshalb zählen wir kleinere Unterschiede nicht.
Was nicht funktioniert hat
Auch Fehlschläge veröffentlichen wir. Jede dieser Ideen sah vielversprechend aus und verlor bei den zurückgehaltenen Suchen.
| Idee | Was passierte |
|---|---|
| Alle 50 Profile in einer einzigen Anfrage lesen | 18 % der Suchen schlugen fehl und liefen ohne das Modell |
| Charakterzüge als feste Etiketten | +3 Punkte, innerhalb der Fehlerspanne |
| Dem Modell den Charakter in Worten beschreiben | Bester Treffer ganz oben fiel von 49 % auf 45 % |
| Die Gewichte per Raster abstimmen | +8 Punkte beim Abstimmen, +2 bei zurückgehaltenen Suchen |
| Deine KI unter zehn Menschen wählen lassen | +1,5 bis +2,3 Punkte |
Wo der Test endet
Die Menschen hier sind erfunden. Echte Profile sind kürzer und unordentlicher, mit Tippfehlern und zwei Sprachen in einem Text.
Ob zwei Menschen gut zusammenarbeiten, zeigt sich im ersten Gespräch. Deshalb bleibt die endgültige Entscheidung bei dir.
Als Nächstes kommen echte Ergebnisse. Angenommene Anfragen und „nicht die richtige Person“ mit Begründung stimmen die Reihenfolge weiter ab.
Folkso ist kostenlos. Verbinde es einmal, und wenn eine Aufgabe das nächste Mal einen Menschen braucht, findet deine KI ihn direkt im Gespräch.