{"id":1744,"date":"2026-07-23T15:58:03","date_gmt":"2026-07-23T13:58:03","guid":{"rendered":"https:\/\/pinkbridge.de\/?p=1744"},"modified":"2026-08-28T19:20:24","modified_gmt":"2026-08-28T17:20:24","slug":"ki-schwaechen-bei-kennzahlen-analyse","status":"publish","type":"post","link":"https:\/\/pinkbridge.de\/en\/ki-schwaechen-bei-kennzahlen-analyse\/","title":{"rendered":"KI versagt noch bei der korrekten KPI-Analyse und -Interpretation. Was hilft wirklich?"},"content":{"rendered":"<div class=\"fusion-fullwidth fullwidth-box fusion-builder-row-1 fusion-flex-container has-pattern-background has-mask-background hundred-percent-fullwidth non-hundred-percent-height-scrolling\" style=\"--awb-border-radius-top-left:0px;--awb-border-radius-top-right:0px;--awb-border-radius-bottom-right:0px;--awb-border-radius-bottom-left:0px;--awb-padding-right:0px;--awb-padding-left:0px;--awb-flex-wrap:wrap;\" ><div class=\"fusion-builder-row fusion-row fusion-flex-align-items-flex-start fusion-flex-content-wrap\" style=\"width:104% !important;max-width:104% !important;margin-left: calc(-4% \/ 2 );margin-right: calc(-4% \/ 2 );\"><div class=\"fusion-layout-column fusion_builder_column fusion-builder-column-0 fusion_builder_column_1_1 1_1 fusion-flex-column\" style=\"--awb-bg-size:cover;--awb-width-large:100%;--awb-margin-top-large:0px;--awb-spacing-right-large:1.92%;--awb-margin-bottom-large:20px;--awb-spacing-left-large:1.92%;--awb-width-medium:100%;--awb-order-medium:0;--awb-spacing-right-medium:1.92%;--awb-spacing-left-medium:1.92%;--awb-width-small:100%;--awb-order-small:0;--awb-spacing-right-small:1.92%;--awb-spacing-left-small:1.92%;\" data-scroll-devices=\"small-visibility,medium-visibility,large-visibility\"><div class=\"fusion-column-wrapper fusion-column-has-shadow fusion-flex-justify-content-flex-start fusion-content-layout-column\"><div class=\"fusion-text fusion-text-1\"><p><strong>\u201eFrag doch einfach die KI nach dem ROAS.\u201c <\/strong>Klingt praktisch. Ist aber riskanter, als die meisten Marketingteams ahnen.<\/p>\n<p>Large Language Models wie ChatGPT oder Claude sind brillant im Formulieren, Zusammenfassen und Erkl\u00e4ren. Bei einer Aufgabe versagen sie jedoch \u00fcberraschend h\u00e4ufig: beim zuverl\u00e4ssigen Rechnen mit echten Gesch\u00e4ftszahlen. Und genau das ist die Kernaufgabe jedes Marketing-Dashboards \u2013 KPI, Conversion Rates, Kampagnenvergleiche, Forecasts.<\/p>\n<h2>Sprachmodell, kein Taschenrechner<\/h2>\n<p>Ein LLM erkennt Zahlen nicht im mathematischen Sinn, sondern als Muster in Text \u2013 \u201e18,4 % ROAS\u201c ist f\u00fcr das Modell zun\u00e4chst eine Zeichenkette, kein Wert mit fester Bedeutung. Genau das zeigten 2024 die vielzitierte GSM-Symbolic-Studie von Apple-Forschern: \u00c4nderten sie in identischen Matheaufgaben nur unwichtige Nebens\u00e4tze oder Zahlenwerte, brach die Trefferquote der Modelle teils deutlich ein. Die Schlussfolgerung: Die Modelle rechnen nicht formal, sie erkennen Muster \u2013 mathematisch identische Aufgaben werden je nach Formulierung unterschiedlich beantwortet.<\/p>\n<h2>Was die Forschung \u00fcbereinstimmend zeigt<\/h2>\n<p>Es blieb nicht bei dieser einen Studie. Weitere unabh\u00e4ngige Untersuchungen best\u00e4tigen das Bild:<\/p>\n<p><strong>NumericBench (2025) <\/strong>zeigt, dass selbst leistungsstarke Modelle wie GPT-4 bei grundlegenden numerischen F\u00e4higkeiten schw\u00e4cheln \u2013 besonders bei Tabellen, langen Kontexten und mehrstufigem Rechnen.<\/p>\n<p><strong>Eine Studie der NYU Abu Dhabi (2025) <\/strong>zu wachsenden Zahlenbereichen fand: Je gr\u00f6\u00dfer oder ungew\u00f6hnlicher die Zahlen in einer Aufgabe, desto mehr logische Fehler passieren \u2013 bis zu 14 Prozentpunkte mehr, bei sonst identischer Aufgabe.<\/p>\n<p><strong>ToRR (2025\/2026)<\/strong>, ein Benchmark f\u00fcr das Rechnen mit Tabellen, kommt zum Schluss: Kein einziges der getesteten Modelle arbeitete \u00fcber alle Tabellenformate hinweg konsistent zuverl\u00e4ssig.<\/p>\n<p><strong>FinChain (2025) <\/strong>pr\u00fcfte mehrstufiges, finanzmathematisches Schlussfolgern bei 26 f\u00fchrenden Modellen \u2013 selbst die st\u00e4rksten Frontier-Modelle zeigten klare Grenzen bei nachvollziehbaren, verifizierbaren Rechenketten.<\/p>\n<p>Der gemeinsame Nenner: Marketingdaten bestehen fast ausschlie\u00dflich aus genau dem, womit LLMs am meisten k\u00e4mpfen \u2013 Tabellen, Zeitreihen, Kennzahlen, mehrstufige Berechnungen.<\/p>\n<h2>Warum das f\u00fcr dein Marketing-Betriebssystem fatal w\u00e4re<\/h2>\n<p>Stell dir vor, dein Kampagnen-Reporting w\u00fcrde bei exakt denselben Daten unterschiedliche Zahlen ausspucken \u2013 je nachdem, wie die Frage formuliert war. Genau das beschreibt die Forschung. F\u00fcr ein System, das Budgetentscheidungen, Lead-Bewertungen oder Next-Best-Actions ableitet, ist das nicht tragbar. KPIs m\u00fcssen reproduzierbar sein \u2013 unabh\u00e4ngig von Formulierung, Tageszeit oder Modellversion.<\/p>\n<h2>Und Code Execution l\u00f6st das nicht allein<\/h2>\n<p>Anthropic hat mit dem Code-Execution-Tool selbst eine Antwort auf das Problem entwickelt: Claude kann kontrolliert Python-Code ausf\u00fchren und dadurch numerisch deutlich zuverl\u00e4ssiger rechnen \u2013 ein echter Fortschritt f\u00fcr explorative Analysen. Aber selbst Anthropic betont die Grenzen: Code Execution entscheidet nicht automatisch, welche Kennzahl \u00fcberhaupt die richtige ist, welche Filter fachlich sinnvoll sind oder wie ein Ergebnis zu interpretieren ist. Das bleiben fachliche Entscheidungen \u2013 keine Rechenaufgaben.<\/p>\n<h2>Die L\u00f6sung: Rechnen trennen von Sprechen<\/h2>\n<p>Die robusteste Antwort aus Forschung und Praxis ist keine bessere Prompt-Formulierung, sondern eine andere Architektur: neurosymbolische Systeme, die klar trennen zwischen einem deterministischen Rechenkern (Business-Logik, KPI, Regeln \u2013 klassischer Code) und einem Sprachmodell, das Ergebnisse erkl\u00e4rt, einordnet und kommuniziert. Aktuelle Forschung zu solchen Hybrid-Architekturen zeigt: Wo Zahlen, Regeln oder Compliance-Pr\u00fcfungen entscheidend sind, geh\u00f6rt die Berechnung in symbolische, deterministische Systeme \u2013 die KI liefert Sprache und Kontext, nicht das Ergebnis selbst.<\/p>\n<p>Erg\u00e4nzt wird das idealerweise durch Verifikationsschleifen (Ergebnis gegen Referenzwert pr\u00fcfen, Toleranzband einhalten) und ein Human-in-the-Loop-Gate f\u00fcr alles, was \u00fcber reine Zahlen hinausgeht \u2013 etwa Ursache-Wirkungs-Interpretationen oder strategische Empfehlungen.<\/p>\n<p>Genau nach diesem Prinzip bauen wir die Architektur von PinkBridge: KPI, Business Rules und Next Best Actions werden deterministisch in der PinkBridge-Engine berechnet. Claude als KI-Partner erkl\u00e4rt die Ergebnisse, f\u00fchrt den Dialog und unterst\u00fctzt bei Content \u2013 rechnet aber nie selbst die Zahlen, die am Ende \u00fcber Budget oder Kampagnenerfolg entscheiden.<\/p>\n<h2>Fazit: KI ist ein exzellenter Erkl\u00e4rer, aber kein Rechenzentrum<\/h2>\n<p>Die aktuelle Forschung ist eindeutig: LLMs sind beeindruckend in Sprache, Kontext und Dialog \u2013 aber (noch) keine verl\u00e4sslichen Rechner f\u00fcr gesch\u00e4ftskritische Kennzahlen. Wer KI im Marketing produktiv einsetzen will, sollte deshalb nicht fragen: \u201eKann die KI das ausrechnen?\u201c, sondern \u201eWo trennen wir Rechnen und Sprechen sauber?\u201c Unternehmen, die diese Trennung architektonisch verankern, bekommen das Beste aus beiden Welten: zuverl\u00e4ssige Zahlen und eine KI, die sie verst\u00e4ndlich macht.<\/p>\n<p><a href=\"mailto:kontakt@pinkbridge.de\">Noch Fragen? Sichere Dir ein Early-Access-Gespr\u00e4ch.<\/a><\/p>\n<p><strong>Quellen<\/strong><\/p>\n<ul>\n<li>Mirzadeh et al. (Apple): <a href=\"https:\/\/arxiv.org\/abs\/2410.05229\" target=\"_blank\" rel=\"noopener\">GSM-Symbolic \u2013 Understanding the Limitations of Mathematical Reasoning in LLMs (2024)<\/a><\/li>\n<li>Li et al.: <a href=\"https:\/\/arxiv.org\/abs\/2502.11075\" target=\"_blank\" rel=\"noopener\">NumericBench \u2013 Exposing Numeracy Gaps (2025)<\/a><\/li>\n<li>Shrestha, Kim, Ross (NYU Abu Dhabi): <a href=\"https:\/\/arxiv.org\/abs\/2502.08680\" target=\"_blank\" rel=\"noopener\">Mathematical Reasoning in LLMs: Assessing Errors across Wide Numerical Ranges (2025)<\/a><\/li>\n<li><a href=\"https:\/\/arxiv.org\/abs\/2406.12719\" target=\"_blank\" rel=\"noopener\">Exploring the Robustness of Language Models for Tabular Question Answering (2024)<\/a><\/li>\n<li><a href=\"https:\/\/arxiv.org\/abs\/2502.19412\" target=\"_blank\" rel=\"noopener\">The Mighty ToRR: A Benchmark for Table Reasoning and Robustness (2025\/2026)<\/a><\/li>\n<li><a href=\"https:\/\/arxiv.org\/abs\/2506.02515\" target=\"_blank\" rel=\"noopener\">FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning (2025)<\/a><\/li>\n<li>Anthropic: <a href=\"https:\/\/platform.claude.com\/docs\/en\/agents-and-tools\/tool-use\/code-execution-tool\" target=\"_blank\" rel=\"noopener\">Code Execution Tool \u2013 Dokumentation<\/a><\/li>\n<\/ul>\n<\/div><\/div><\/div><\/div><\/div>","protected":false},"excerpt":{"rendered":"<p>KI kann brillant erkl\u00e4ren, aber schlecht rechnen: Aktuelle Studien zeigen, dass LLMs bei KPI, Tabellen und Kennzahlen unzuverl\u00e4ssig sind \u2013 identische Rechenaufgaben liefern je nach Formulierung unterschiedliche Ergebnisse. Warum das f\u00fcr dein Marketing-Reporting gef\u00e4hrlich ist und wie eine saubere Architektur das Problem l\u00f6st. <a href=\"https:\/\/pinkbridge.de\/en\/ki-schwaechen-bei-kennzahlen-analyse\/\"> Artikel lesen<\/a><\/p>","protected":false},"author":2,"featured_media":1773,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"_jetpack_newsletter_access":"","_jetpack_dont_email_post_to_subs":false,"_jetpack_newsletter_tier_id":0,"_jetpack_memberships_contains_paywalled_content":false,"_jetpack_feature_clip_id":0,"_jetpack_memberships_contains_paid_content":false,"footnotes":"","jetpack_post_was_ever_published":false},"categories":[19],"tags":[],"class_list":["post-1744","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ki-marketingsteuerung"],"jetpack_sharing_enabled":true,"jetpack_featured_media_url":"https:\/\/pinkbridge.de\/wp-content\/uploads\/2026\/07\/KI-Rechenfehler-3.png","_links":{"self":[{"href":"https:\/\/pinkbridge.de\/en\/wp-json\/wp\/v2\/posts\/1744","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/pinkbridge.de\/en\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/pinkbridge.de\/en\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/pinkbridge.de\/en\/wp-json\/wp\/v2\/users\/2"}],"replies":[{"embeddable":true,"href":"https:\/\/pinkbridge.de\/en\/wp-json\/wp\/v2\/comments?post=1744"}],"version-history":[{"count":6,"href":"https:\/\/pinkbridge.de\/en\/wp-json\/wp\/v2\/posts\/1744\/revisions"}],"predecessor-version":[{"id":1805,"href":"https:\/\/pinkbridge.de\/en\/wp-json\/wp\/v2\/posts\/1744\/revisions\/1805"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/pinkbridge.de\/en\/wp-json\/wp\/v2\/media\/1773"}],"wp:attachment":[{"href":"https:\/\/pinkbridge.de\/en\/wp-json\/wp\/v2\/media?parent=1744"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/pinkbridge.de\/en\/wp-json\/wp\/v2\/categories?post=1744"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/pinkbridge.de\/en\/wp-json\/wp\/v2\/tags?post=1744"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}