---

title: "Visibilité IA : avec la recherche web, une même marque peut reculer sur un moteur et progresser sur l'autre"

description: "360 réponses de GPT et Gemini sur 30 questions d'achat CRM, avec et sans recherche web. Pour 3 marques sur 15, l'effet associé à la recherche diffère nettement selon le moteur et sa configuration. Résultats, méthode et limites."

canonical: https://citabl.ai/insights/visibilite-ia-search-gpt-gemini

datePublished: 2026-10-02

dateModified: 2026-10-03

author: "Citabl"

section: "Data posts"

keywords: "visibilité IA, AI Search, GEO, Answer Share, GPT, Gemini, recherche web, fan-out, CRM, marketing B2B"

source: https://citabl.ai/insights/visibilite-ia-search-gpt-gemini

---


# Visibilité IA : avec la recherche web, une même marque peut reculer sur un moteur et progresser sur l'autre

> 360 réponses de GPT et Gemini sur 30 questions d'achat CRM, avec et sans recherche web. Pour 3 marques sur 15, l'effet associé à la recherche diffère nettement selon le moteur et sa configuration. Résultats, méthode et limites.

**noCRM.io**, logiciel CRM, est cité dans 14 % des réponses sans recherche web et dans 19 % avec. En moyenne, la recherche s'accompagne d'environ 5 points de plus. Rien de remarquable.

Séparons les deux moteurs.

Chez GPT, avec la recherche web, noCRM.io passe de 27,8 % à 7,8 % des réponses : **−20 points**. Chez Gemini, la marque passe de 1,1 % à 30,0 % : **+29 points**.

Mêmes 30 questions. Même période. Deux tendances opposées, que la moyenne efface presque entièrement.

Cette note documente l'expérience qui a produit ce résultat, ce qu'il permet de dire et ce qu'il ne permet pas de dire.

## Le dispositif en 30 secondes

- **30 situations d'achat CRM**, rédigées en français, sans aucun nom de marque dans la question.
- **15 marques CRM suivies** dans chaque réponse.
- **2 moteurs** interrogés par API : GPT-5.4 (OpenAI) et Gemini 2.5 Flash (Google).
- **2 conditions** : avec recherche web et sans recherche web.
- **3 répétitions** de chaque combinaison.

Au total : 360 réponses et 5 400 observations marque × réponse.

Dans cette étude, la **visibilité IA** désigne la proportion de réponses dans lesquelles une marque est explicitement mentionnée. Les réponses proviennent des API des moteurs, et non de ChatGPT ou de l'application Gemini.

## Résultat 1 : pour trois marques, l'effet de la recherche dépend du moteur

Pour chaque marque, nous avons mesuré l'écart de mention entre réponses avec et sans recherche, séparément chez GPT et chez Gemini, puis la différence entre ces deux écarts. Le test porte sur les 15 marques, avec une correction pour comparaisons multiples (Holm).

Trois marques présentent un contraste net après correction :

| Marque | Écart avec recherche chez GPT | Écart avec recherche chez Gemini | Contraste [IC95 %] |

| --- | --- | --- | --- |

| noCRM.io | 27,8 % → 7,8 % : −20,0 pts | 1,1 % → 30,0 % : +28,9 pts | +48,9 [+30,0 ; +70,0] |

| Sellsy | 40,0 % → 23,3 % : −16,7 pts | 8,9 % → 56,7 % : +47,8 pts | +64,4 [+46,7 ; +82,2] |

| Axonaut | 11,1 % → 11,1 % : 0,0 pt | 4,4 % → 44,4 % : +40,0 pts | +40,0 [+21,1 ; +58,9] |

| 12 autres marques (agrégées) | −3,5 pts | −2,0 pts | aucune ne passe le seuil corrigé |

Pour **noCRM.io et Sellsy**, les signes sont opposés : moins de mentions avec la recherche chez GPT, davantage chez Gemini. Pour **Axonaut**, rien ne bouge chez GPT et tout le contraste vient de Gemini.

Une quatrième marque, **Freshsales**, présente un contraste en sens inverse (la recherche s'accompagne de moins de mentions chez Gemini). Il passe le seuil corrigé sur la lecture « présence stable » (p = 0,028) mais pas sur le taux brut (p = 0,054). Nous ne la comptons pas.

**Pour les 12 autres marques, nous ne détectons pas ce même contraste net entre moteurs après correction statistique.** Cela ne signifie pas qu'aucune différence n'existe : seulement que ce dispositif ne permet pas de la détecter.

Ces écarts sont mesurés entre deux moteurs dont la configuration de recherche différait (voir Périmètre de l'étude). Ils ne peuvent pas être attribués au seul moteur.

## Résultat 2 : la moyenne globale masque une redistribution

À l'échelle de toutes les marques suivies :

- **Chez GPT**, les réponses avec recherche mentionnent en moyenne environ 14 % de marques suivies en moins par réponse (5,0 contre 5,8). Taux de mention : 33,1 % contre 38,4 %, soit −5,3 points [IC95 % : −10,8 ; −0,3]. La baisse concerne aussi les 12 marques sans contraste particulier.
- **Chez Gemini**, les réponses avec recherche mentionnent en moyenne 5,4 marques contre 4,5. Taux de mention : 36,1 % contre 30,0 %, soit +6,1 points, mais l'intervalle [−3,9 ; +17,2] inclut zéro. Cette hausse est portée par trois marques : sans elles, les 12 autres marques reculent légèrement (−2,0 points, compatible avec zéro).

Dans ce panel, on observe descriptivement davantage de disparitions que d'émergences chez GPT, et l'inverse chez Gemini. Ces écarts ne sont pas robustes une fois la variabilité entre marques prise en compte. Ils ne doivent pas être lus comme une règle générale sur les moteurs.

## Résultat 3 : chez GPT, la plupart des présences stables ne changent pas avec la recherche

Chez GPT, parmi les couples situation × marque cités de façon reproductible (au moins 2 réponses sur 3) dans au moins un des deux modes, **74 % le sont dans les deux modes** (134 sur 182, IC95 % [52 ; 87]). Chez Gemini, 55 % (105 sur 190, IC95 % [30 ; 75]) : l'intervalle est trop large pour parler de majorité.

Avec seulement trois répétitions, une présence réellement stable peut tomber sous le seuil de 2 sur 3 dans l'un des modes par simple variabilité. Ces parts sont donc probablement sous-estimées.

## Ce que ça change pour une équipe marketing

**Le score agrégé n'est pas faux. Il répond à une question trop large.**

### 1. Lire la visibilité moteur par moteur

Un score « visibilité IA » qui fusionne GPT et Gemini aurait montré +5 points pour noCRM.io. La réalité est −20 points sur un moteur et +29 sur l'autre. Les deux appellent des investigations différentes. Une marque qui ne suit qu'un moteur, ou qu'une moyenne, ne voit pas cet écart.

### 2. Descendre au niveau de la situation d'achat

Une même marque peut rester stable sur une question, apparaître avec la recherche sur une autre et disparaître sur une troisième. Une visibilité moyenne sur 30 questions peut cacher une absence totale sur les quelques questions qui comptent pour un segment précis.

### 3. Séparer mesurer, expliquer et optimiser

Nos données mesurent un écart. Elles ne l'expliquent pas. Savoir que noCRM.io recule avec la recherche chez GPT ne dit pas encore quoi changer : contenus, sources tierces, configuration, ou rien de tout cela. Passer directement d'une mesure à une action d'optimisation revient à parier sur une cause qui n'a pas été établie.

## Le point de départ : le fan-out

Cette expérience est née d'une question posée par une étude publiée sur arXiv le 19 septembre 2026 par Benjamin Tannenbaum ([From Prompt to Recommendation: A Fitted Stage Model of Brand Visibility in AI Search](https://arxiv.org/abs/2609.23162)), qui analyse 34 960 observations sur GPT et Gemini.

Quand un moteur utilise la recherche web, il lance ses propres requêtes intermédiaires avant de répondre. On appelle cet ensemble le **fan-out**. Une partie de ces requêtes est observable par API. Notre question était simple : **quand une marque apparaît dans les recherches intermédiaires d'un moteur, aurait-elle aussi été citée sans recherche ?**

### Une association très forte

Chez GPT via API, une marque présente dans les requêtes intermédiaires observables est mentionnée dans **85,9 % des cas** (407 sur 474), contre **2,2 %** lorsqu'elle n'y apparaît pas (18 sur 831).

L'association résiste au contrôle par marque : +72,2 points à marque égale [IC95 % : +61,7 ; +80,4], et encore +53,7 points en comparant la même marque sur la même question d'une répétition à l'autre [+41,2 ; +65,8]. Ce n'est donc pas un simple effet « grandes marques ».

### Mais chez GPT, ces marques étaient presque toujours déjà là sans recherche

Dans **87 % des occurrences** où GPT recherche une marque puis la cite, cette même marque apparaît aussi dans au moins deux des trois réponses sans recherche correspondantes. Dans 79,6 % des cas, elle apparaît dans les trois.

Et sans recherche, GPT cite au total un peu plus de marques qu'avec.

Le fan-out observable est donc un signal très fortement associé à la mention finale. Nos données ne montrent pas qu'il en est l'origine, ni qu'agir dessus modifierait la réponse.

Chez Gemini, le même indicateur se comporte autrement : dans 71 des 88 réponses avec recherche observables, aucune des 15 marques n'apparaît dans les requêtes intermédiaires, alors que ces réponses citent plusieurs marques. Un même signal observable ne se lit pas de la même façon d'un moteur à l'autre.

## Ce que l'expérience ne permet pas de dire

- Que la recherche web fait gagner ou perdre de la visibilité en général.
- Que le fan-out provoque la mention d'une marque, ou qu'il est inutile.
- Que GPT ou Gemini « préfèrent » certaines marques.
- Que ces résultats s'appliquent à ChatGPT, à l'application Gemini, à d'autres catégories, à d'autres marchés ou à d'autres versions des modèles.
- Pourquoi noCRM.io, Sellsy et Axonaut se comportent ainsi.
- Quoi que ce soit sur la qualité de ces produits : nous mesurons ce que les moteurs écrivent, pas ce que valent les logiciels.

## Périmètre de l'étude

Ces résultats valent pour ce qui a été testé : le marché CRM en France, 30 situations d'achat, 15 marques, GPT-5.4 et Gemini 2.5 Flash via API, une collecte réalisée le 25 septembre 2026.

Les deux moteurs n'utilisaient pas exactement la même configuration de recherche : OpenAI recevait une localisation France, Gemini aucune. C'est pourquoi nous parlons d'écarts « selon le moteur et sa configuration ».

**Prochaine étape** : nous relançons la collecte à l'identique, puis avec une localisation harmonisée, pour mesurer ce qui tient d'une collecte à l'autre et ce qui relève de la configuration. Les résultats seront publiés ici, qu'ils confirment ou non ceux-ci.

## Méthodologie

### Paramètres d'exécution

- **Corpus** : 30 prompts en français (`fanout-pilot-crm-fr-v1`), marché France, sans nom de marque.
- **OpenAI** : `gpt-5.4-2026-03-05` via l'API Responses (`POST /v1/responses`). En condition avec recherche, outil `web_search` avec une localisation approximative `country = FR`. Aucun outil en condition sans recherche.
- **Gemini** : `gemini-2.5-flash` via `generateContent`, appelé à travers LiteLLM 1.81.0. En condition avec recherche, Google Search grounding (`googleSearch`), sans localisation explicite. Aucun outil en condition sans recherche.
- **Paramètres de génération** : le harness n'a fixé ni `temperature`, ni `top_p`, ni `max_tokens` / `max_output_tokens`. OpenAI rapporte avoir appliqué `temperature = 1`, `top_p = 0,98` et aucune limite explicite de sortie. Gemini ne retourne pas les valeurs effectivement appliquées.
- **Plan d'exécution** : 360 appels exécutés séquentiellement dans un ordre aléatoire global (graine `20260925`), avec moteurs, conditions et répétitions entremêlés.
- **Fenêtre de collecte** : 25 septembre 2026, de 08:51 à 11:41 UTC, avec une interruption technique de 44 minutes puis reprise à l'identique.
- **Écart avec / sans recherche** : pour un même prompt et un même moteur, les deux conditions sont séparées de 42,9 minutes en médiane, 163,6 minutes au maximum.
- **Incidents** : 4 erreurs HTTP 500 du proxy, sans appel fournisseur, toutes relancées avec succès. Les 360 réponses analysées sont des HTTP 200.

### Mesures

- **Mention** : détection déterministe du nom de chaque marque dans la réponse finale, avec adjudication humaine des cas ambigus (par exemple « Sage » pour Sage CRM ou un produit comptable).
- **Fan-out** : une marque est codée présente lorsqu'elle est explicitement identifiable dans une requête intermédiaire observable. Une requête non observable reste non renseignée, jamais codée comme absence.

### Statistiques

- Intervalles de confiance à 95 % par bootstrap : rééchantillonnage des 30 prompts, ou croisé prompts × marques selon l'analyse.
- Contraste entre moteurs : test de randomisation par prompt (échange aléatoire des étiquettes de moteur), correction de Holm sur les 15 marques.
- Contrôle par marque : différence de risque de Mantel-Haenszel stratifiée par marque.

### Traçabilité

- Dataset final : `observations_semantic.csv`, 5 400 observations.
- SHA-256 : `6e18e264512292967fcbc106296815fb136ca24310d97e70bdf83bce4206e39c`
- Les hashes ont été vérifiés avant et après chaque analyse. Aucune analyse n'a modifié les données ni relancé de modèle.

## Questions fréquentes

### La recherche web améliore-t-elle la visibilité d'une marque dans les réponses IA ?

Pas de façon générale dans cette expérience. Chez GPT via API, les réponses avec recherche mentionnent légèrement moins de marques. Chez Gemini, la hausse observée n'est pas robuste et se concentre sur trois marques.

### Une même marque peut-elle gagner sur un moteur et perdre sur l'autre ?

Oui, dans ce protocole. Pour 2 marques sur 15, la recherche web s'accompagne de moins de mentions chez GPT et de davantage chez Gemini, sur les mêmes questions.

### Faut-il optimiser le fan-out ?

Nos données ne permettent pas de le recommander. La présence d'une marque dans les requêtes intermédiaires de GPT est très fortement associée à sa mention, mais dans 87 % des cas la marque était aussi citée sans recherche.

### Peut-on se fier à un score de visibilité IA moyen ?

Il est utile pour une vue d'ensemble, mais il peut masquer des écarts opposés entre moteurs. Pour noCRM.io, une moyenne de +5 points cachait −20 points sur un moteur et +29 sur l'autre.

Note de recherche Citabl. Panel de 15 CRM suivis : Pipedrive, HubSpot, Sellsy, Zoho CRM, monday CRM, Salesforce, Microsoft Dynamics 365, noCRM.io, Axonaut, Tribe CRM, Sage CRM, Eudonet, Odoo, Teamleader, Freshsales. Les chiffres décrivent les réponses des API GPT-5.4 et Gemini 2.5 Flash collectées le 25 septembre 2026, sur une seule collecte non encore répliquée. Les éditeurs cités peuvent demander les données détaillées qui les concernent : nous les partagerons, et publierons toute correction justifiée.

## Action

**Mesurez votre Answer Share**

Diagnostic standardisé de votre visibilité IA.

👉 Réserver un diagnostic


---

_Canonical: https://citabl.ai/insights/visibilite-ia-search-gpt-gemini_
