Julie progresse.
Dans ce qui compte.
Des réponses mieux étayées. Moins d’affirmations inventées signalées. Une génération plus économe. Une nouvelle étape pour Julie, mesurée sur notre benchmark juridique interne.
Découvrir les progrès
01 / Les résultats
Une différence qui se mesure.
Nous avons soumis la version précédente et cette évolution de Julie aux mêmes questions. Voici les progrès observés sur l’ensemble des réponses évaluées.
Réponses étayées par les sources
81 → 95 %Part des réponses · plus élevé = mieuxDe 81 % à 95 % de réponses étayées : un gain de 14 points dans notre benchmark interne. Cet indicateur mesure l’appui sur les sources, pas la justesse complète.
Réponses avec une hallucination signalée
10 → 1 %Part des réponses · plus faible = mieuxDe 10 % à 1 % de réponses concernées dans cet échantillon. Un signal d’amélioration, sans garantie d’absence d’erreur.
Économie de génération
≈ −23 %Économie par rapport à la version précédenteEnviron 23 % de coût de génération enregistré en moins. Les tarifs et quotas clients restent inchangés.
Les deux premiers graphiques montrent les taux observés, sans normalisation : chaque barre représente une part des réponses. Le troisième montre directement l’économie relative de génération. Les coûts concernent l’usage enregistré ; certaines tentatives interrompues n’ont pas retourné leur consommation. Lire la méthode ↗
02 / Une Julie plus efficace
Plus de place à l’essentiel.
Une bonne réponse commence par une bonne préparation. Nous avons amélioré la manière dont Julie prépare les informations utiles à son analyse : une matière plus ciblée, pour mieux se concentrer sur votre question.
- Une analyse mieux ciblée
- Le texte reçu au moment de rédiger est plus compact dans notre test. L’objectif : donner leur place aux éléments qui comptent pour la réponse.
- Des sources toujours consultables
- Les décisions citées conservent leur texte d’origine disponible dans les sources. Vous pouvez revenir à ce qui fonde la réponse.
Texte reçu pour rédiger
≈ −26 %Réduction mesurée du volume d’entréeVolume d’entrée à l’étape de rédaction, comparé à la version intermédiaire avant optimisation. Cette mesure ne concerne pas l’ensemble du travail de Julie.
03 / Avant / après
Le progrès se lit aussi dans les détails.
Une majorité à vérifier. Un délai à distinguer. Deux situations de notre benchmark montrent comment une réponse peut devenir plus utile, avec les passages décisifs surlignés.
La même situation. Une réponse qui progresse.
Indivision · Plantation sur une parcelle détenue en commun
Questions reformulées et anonymisées ; extraits authentiques des versions comparées dans les graphiques, surlignage ajouté. Cas sélectionnés parmi les améliorations, non représentatifs de l’ensemble des réponses.
Ce qui fait la différence
Distinguer les règles
La nouvelle réponse sépare la conservation, l’administration et les actes hors exploitation normale. Elle précise quand l’unanimité est nécessaire.
Repérer une condition oubliée
Informer les autres indivisaires est une obligation. La nouvelle réponse précise aussi la conséquence d’un défaut d’information.
Mieux lire la jurisprudence
Une décision sur une construction ne garantit pas le même résultat pour un arbre. Julie explicite cette limite au lieu de promettre un recours certain.
La qualification dépend des faits. La réponse évaluée ne traite pas le mandat tacite de gestion : cet exemple illustre des distinctions mieux expliquées, pas une analyse exhaustive.
04 / Notre méthode
Des résultats, pas une promesse absolue.
Une évaluation interne sur les mêmes questions et la même grille. Les chiffres décrivent la version évaluée, avant sa mise en ligne. Ils ne garantissent pas le résultat de chaque réponse.
Ce que nous avons comparé
49 conversations, soit 100 réponses par version, au niveau de raisonnement intermédiaire. Les réponses sont notées avec leur contexte de conversation, selon la même grille et par le même modèle évaluateur. Les figures principales comparent la version d’origine à la dernière évolution ayant terminé cette évaluation ; la figure d’optimisation compare cette dernière à la version intermédiaire.
Comment lire les pourcentages
Les deux graphiques de qualité montrent les taux réellement observés : 81 % puis 95 % de réponses étayées par les sources, et 10 % puis 1 % de réponses avec une hallucination signalée. Une réponse étayée peut rester incomplète ou incorrecte : cet indicateur n’est pas un score de justesse. Les économies de coût et de volume sont des réductions relatives affichées directement, sans fixer artificiellement la version précédente à 100 %.
Les intervalles à 95 %, calculés sur 5 000 rééchantillonnages par conversation, vont d’environ +6 à +23 points pour l’étayage, de −16 à −3 points pour les hallucinations signalées, et de 14 à 30 % pour l’économie de génération. La baisse des hallucinations part d’une fréquence faible dans ce petit échantillon. Ils ne couvrent pas toute la variabilité des sources, des conditions d’exécution ou de la notation.
Les limites à garder en tête
L’échantillon reste limité ; des questions se répètent, certaines pièces manquent au rejeu, et la notation comporte des incohérences. Certaines réponses régressent. Le corpus et la concurrence d’exécution ont changé : la comparaison porte sur l’évolution dans son ensemble, sans isoler l’effet de chaque optimisation.
La version évaluée répond plus lentement en médiane. Nous ne revendiquons donc pas de gain de vitesse. Les travaux ultérieurs sur l’exécution en parallèle ne sont pas mesurés ici.
L’économie concerne les appels aux modèles enregistrés, hors recherche, évaluation et infrastructure. L’usage de certaines tentatives interrompues est inconnu : il ne s’agit pas d’un relevé de facturation exhaustif. Les tarifs des abonnements et les quotas restent inchangés.