Question :
Comment fonctionne le traitement en texte intégral ?
Réponse :
Une fois un document stocké dans une armoire avec la prise en charge du texte intégral activée, l’indexation du texte intégral de ce document commence immédiatement.
Les tâches d’OCR et d’indexation du texte intégral sont générées dans la table dwsystem.dbo.DWTASKS avec les TASK_TYPE 0 et 2, respectivement, puis traitées par le Background Process Service. Le Fulltext Server lui-même est uniquement chargé de la Recherche plein texte et n’effectue pas l’indexation plein texte. Il doit toutefois être en cours d’exécution pour recevoir les données de recherche plein texte pendant l’indexation.
Présentation des TASK_TYPE de recherche plein texte dans la table dwsystem.dbo.DWTASKS :
TASK_TYPE 0 : OCR
TASK_TYPE 1 : Création de « textshot » par l’Intelligent Indexing
TASK_TYPE 2 : L’index plein texte est mis à jour dans la base de données et exporté vers le cœur SOLR, afin que le Fulltext Server y ait accès
TASK_TYPE 3 : Nettoyage SOLR après suppression de documents
TASK_TYPE 4 : Tâche de mise à niveau depuis une ancienne version de DocuWare (n’est plus utilisée depuis DocuWare 7 ; supprimez manuellement cette tâche si vous la rencontrez)
TASK_TYPE 5 : Tâche de réinitialisation du texte intégral (vérifiez la colonne « Paramètres » pour connaître l’état actuel ; les documents sont traités du dwdocid le plus élevé au plus bas)
Les données de texte intégral sont écrites dans les tables _PAG et _PGT d’une armoire. Ces données peuvent être supprimées en toute sécurité, si nécessaire, à condition de les supprimer à la fois de _PGT et de _PAG. Vous devrez effectuer une réinitialisation du texte intégral si vous souhaitez régénérer vos données d’indexation du texte intégral par la suite.
Remarque : contrairement à DocuWare 6, la table _SEC ne contient aucune donnée de recherche plein texte ! Ne supprimez jamais les lignes correspondant à des documents existants de la table _SEC !
Une fois qu’un document est entièrement indexé côté base de données, l’indexde recherche plein texte est ensuite transféré vers le noyau SOLR. Ces cœurs se trouvent dans l’emplacement de stockage de l’index plein texte défini dans votre connexion plein texte. Cela peut être configuré dans l’outil d’administration (dans les versions 7.0 à 7.13) ou dans le DocuWare Server Manager (à partir de la version 7.14) -> Connexions de données.
Les cœurs portent le nom du GUID d’une armoire. Ce GUID peut être vérifié dans la section de configuration de l’armoire de la configuration Web, sous Général -> Plus d’options.
Aperçu des valeurs STATUS dans la table _PGT :
0 = Nouveau
1 = Textshot créé avec succès
2 = Erreur lors de la création du textshot
3 = Textshot transféré avec succès vers SOLR
4 = Erreur lors du transfert vers SOLR
Ce n’est qu’une fois que les données de recherche plein texte d’un document auront été entièrement transférées vers SOLR que vous pourrez retrouver le document via la Recherche plein texte.
La KBA s'applique UNIQUEMENT aux organisations disposant d'une installation sur site.
Remarque : cet article est une traduction de l’anglais. Les informations contenues dans cet article sont basées sur la ou les versions originales du produit en anglais. Il peut y avoir des erreurs mineures, notamment au niveau de la grammaire, dans la version traduite de nos articles. Bien que nous ne puissions garantir l'exactitude totale de la traduction, vous la trouverez, dans la plupart des cas, suffisamment informative. En cas de doute, veuillez vous reporter à la version anglaise de cet article.
