WhatsApp 2026 : facturation au token et fin des réponses de service gratuites — ce qui change
Si votre entreprise gère son support ou ses ventes sur l'API WhatsApp Business, le second semestre 2026 change vos équations économiques deux fois en trois mois. Il ne s'agit pas d'ajustements tarifaires mineurs : c'est la nature même de ce qui est facturé qui change — à l'avantage des équipes qui architecturent soigneusement leur automatisation.
Échéance n°1 — 1er août 2026 : l'IA passe au compteur de tokens
Jusqu'ici, la facturation WhatsApp reposait sur des catégories de conversation : utilitaire, marketing, authentification et fenêtres de service. Avec des agents IA qui tiennent désormais de longues conversations libres, Meta ajoute un modèle bien connu des fournisseurs de LLM : les traitements assurés par l'IA native de Meta passent à la facturation au token, au tarif indicatif d'environ 2,00 $ par million de tokens.
Le danger n'est pas le tarif affiché — c'est l'inflation du contexte. Un agent IA qui recharge tout votre catalogue produits, le profil CRM et vos consignes à chaque tour de parole peut consommer des dizaines de milliers de tokens en une session. Multipliez par des milliers de conversations mensuelles, et un chatbot anodin devient une vraie ligne budgétaire.
Échéance n°2 — 1er octobre 2026 : la fenêtre gratuite de 24 h se referme
Aujourd'hui, quand un client vous écrit en premier, vos réponses dans la fenêtre de service de 24 heures sont gratuites. À partir du 1er octobre, ce palier gratuit disparaît : chaque réponse hors modèle — d'un bot ou d'un humain — devient facturable. Un bot bavard qui a besoin de dix tours de clarification coûtera plusieurs fois plus cher qu'un bot qui résout l'intention en deux.
Ce que ça signifie au Maroc et dans la région
WhatsApp est la colonne vertébrale de la confirmation COD, de la prise de rendez-vous, de la qualification de leads et de la gestion de sinistres dans la région — précisément les flux à fort volume de messages. Trois réalités locales aiguisent encore l'enjeu :
- Les questions routinières dominent. Une grande part du trafic entrant, ce sont des salutations, des horaires, des prix et des statuts de commande — des questions triviales qui ne devraient jamais payer le prix d'un LLM.
- Darija et notes vocales. Une part importante des messages clients marocains arrive en notes vocales en darija. Pousser l'audio brut dans un pipeline IA générique gonfle les tokens et comprend mal le dialecte.
- Règles de données. Faire transiter les identités clients par des traitements IA opaques à l'étranger soulève des questions au regard du cadre marocain de protection des données (CNDP, loi 09-08). Contrôler où tourne l'IA compte.
Le plan SalesRep : ne payer l'intelligence que lorsqu'elle est nécessaire
SalesRep est construit autour d'un principe qui a soudain un prix : la plupart des messages n'ont jamais besoin d'un LLM.
- Les flux répondent d'abord, gratuitement. Le créateur de flux WhatsApp visuel résout les questions à mots-clés — prix, horaires, catalogues, statut de commande — par des réponses instantanées en modèles et médias qui ne consomment aucun token d'IA. Seules les questions réellement ouvertes atteignent l'étape de transfert IA.
- Les boutons éliminent les tours de clarification. Boutons de réponse et listes interactives capturent l'intention dès le premier message, réduisant dix tours de conversation à deux — doublement rentable après le 1er octobre.
- Vous choisissez l'IA, et son prix. Via le connecteur OpenRouter, SalesRep route les conversations IA sur plus de 300 modèles, avec un Auto Router et un routage économique qui choisit le fournisseur capable le moins cher pour chaque requête — prix par modèle affichés en direct. Ou apportez votre propre LLM (Ollama, vLLM, tout endpoint privé) et gardez coûts et données chez vous.
- La darija traitée correctement. Les notes vocales sont transcrites par une reconnaissance vocale réglée pour la darija — y compris l'arabizi en caractères latins — pour que l'IA raisonne sur du texte propre et compact plutôt que sur des transcriptions gonflées.
- Les humains prennent les cas difficiles. Tout ce que l'automatisation ne résout pas atterrit dans la boîte de réception d'équipe avec le contexte complet : l'escalade coûte un transfert, pas dix tours d'IA.
Votre liste de préparation en quatre étapes
- Auditez votre trafic dès maintenant : quelle part de FAQ répétitives, quelle part de vocal, combien de tours par résolution ?
- Sortez les FAQ du chemin de l'IA vers des flux à mots-clés et des réponses médias.
- Remplacez les questions ouvertes par des boutons partout où le choix est fini.
- Reprenez le contrôle de votre dépense IA — routez vers des modèles optimisés en coût ou votre propre LLM plutôt que de subir la facturation native par défaut.
Les équipes qui se préparent avant août vivront ces changements comme une poussière d'arrondi. Les autres les découvriront sur leur facture. Lancez un essai SalesRep gratuit de 21 jours, connectez votre numéro, et mesurez exactement quelle part de votre trafic peut être traitée avant qu'un seul token ne soit facturé.