WO2015114014A1 - Procédé d'analyse sémantique d'un texte - Google Patents

Procédé d'analyse sémantique d'un texte Download PDF

Info

Publication number
WO2015114014A1
WO2015114014A1 PCT/EP2015/051722 EP2015051722W WO2015114014A1 WO 2015114014 A1 WO2015114014 A1 WO 2015114014A1 EP 2015051722 W EP2015051722 W EP 2015051722W WO 2015114014 A1 WO2015114014 A1 WO 2015114014A1
Authority
WO
WIPO (PCT)
Prior art keywords
theme
coefficient
text
subset
words
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Ceased
Application number
PCT/EP2015/051722
Other languages
English (en)
Inventor
Jean-Pierre Malle
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
DEADIA
Original Assignee
DEADIA
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by DEADIA filed Critical DEADIA
Priority to US15/114,648 priority Critical patent/US10289676B2/en
Priority to CA2937930A priority patent/CA2937930A1/fr
Priority to EP15703746.6A priority patent/EP3100176A1/fr
Publication of WO2015114014A1 publication Critical patent/WO2015114014A1/fr
Anticipated expiration legal-status Critical
Ceased legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/30Information retrieval; Database structures therefor; File system structures therefor of unstructured textual data
    • G06F16/35Clustering; Classification
    • G06F16/355Creation or modification of classes or clusters
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/30Information retrieval; Database structures therefor; File system structures therefor of unstructured textual data
    • G06F16/33Querying
    • G06F16/3331Query processing
    • G06F16/334Query execution
    • G06F16/3344Query execution using natural language analysis
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00Handling natural language data
    • G06F40/20Natural language analysis
    • G06F40/205Parsing
    • G06F40/211Syntactic parsing, e.g. based on context-free grammar [CFG] or unification grammars
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00Handling natural language data
    • G06F40/30Semantic analysis
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00Handling natural language data
    • G06F40/20Natural language analysis
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00Handling natural language data
    • G06F40/40Processing or translation of natural language

Definitions

  • the present invention relates to the field of computer semantic understanding.
  • a coverage coefficient of a theme is calculated in step (d) as the number N of reference words associated with the theme included in said subset;
  • a coefficient of relevance of a theme is calculated in step (d) by the formula N * (1 + ln (#)), where N is the number of reference words associated with the theme included in the sub-group. together and R the total number of occurrences in said part of the text of reference words associated with the theme;
  • step (c) • two thematic orientation coefficients are calculated in step (c), including a theme certainty coefficient and a thematic shade coefficient;
  • a certainty coefficient of a theme is calculated in step (d) as:
  • a shade coefficient of a theme is a positive scalar greater than 1 when the words that are not part of the subset are representative of an amplification of the theme, and a positive scalar less than 1 when the words that do not part of the subset are representative of an attenuation of the theme;
  • the method comprises a step (aO) preceding the cutting of the text into a plurality of propositions, each being a part of the text for which the steps (a) to (d) of the method are repeated so as to obtain for each proposition a set of the coverage, relevance, and / or orientation coefficients associated with the proposal, the method comprising, before step (e), a step (eO) of calculation for each of said subsets and for each theme identified for minus a proposal of the text of a global coefficient of coverage of the theme and / or of an overall coefficient of relevance of the theme, and of at least one overall orientation coefficient of the theme according to all of said coefficients associated with a proposition;
  • An overall coefficient of coverage of a theme is calculated in step (eO) as the sum of the coverage coefficients of the theme associated with a proposition minus the number of reference words of the theme present in at least two propositions;
  • step (eO) an overall coefficient of relevance of a theme is calculated in step (eO) as the sum of the relevance coefficients of the theme associated with a proposition;
  • the step (eO) includes for each of said subsets and for each theme the calculation of an overall coefficient of divergence of the theme corresponding to the standard deviation of the product distribution of the products. orientation coefficients by the coverage coefficients associated with each proposal;
  • the subset / thematic pairs selected in step (f) are those such that for any partition of the subset into a plurality of parts of said subset, the semantic coefficient of the subset for the theme is greater than the sum of the semantic coefficients of the sub-parts of the subset for the theme;
  • the invention relates to an equipment comprising data processing means configured to implement following the reception of a text in natural language a method according to the first aspect of the invention semantic text analysis .
  • FIG. 1 is a diagram of a network architecture embodying the invention
  • the present method is implemented by data processing means 11 (which typically consist of one or more processors) of a piece of equipment 1.
  • the latter can be for example one or more servers connected to a network 4, typically the Internet, via which it is connected to clients 2 (for example personal computers).
  • the equipment 1 further comprises data storage means 12 (typically one or more hard disks).
  • a text here is any message in natural and meaningful language.
  • the text is received in electronic form, that is to say in a format directly processable by the processing means 1 1, for example XML (Extensible Markup Language).
  • XML Extensible Markup Language
  • input means 14 is meant a wide variety of origins.
  • the term input means means any means, hardware and / or software, for recovering the text and send it to the data processing means 11 in a readable format.
  • the text can be directly typed by a user, and the input means 14 refer for example to a keyboard and word processing software.
  • the text may be a paper text scanned and recognized by OCR (Optical Character Recognition), and the input means 14 then designate a scanner and a digital data processing software, or the text can be dictated and the means input 14 then designate a microphone and voice recognition software.
  • OCR Optical Character Recognition
  • the text can be received for example from a server of the Internet network, possibly directly in a readable format.
  • the present method is not limited to any type of text.
  • the input means are typically those of a client 2 or another server 1.
  • a sentence is composed of propositions separated by a punctuation (comma, semi-colon).
  • a word is an ordered set of letters and special signs (accents, hyphens, etc.).
  • a first step (a), called "parsing” at least a portion of the text is cut syntactically into a plurality of words.
  • this part of the sentence is a proposition
  • the text is first cut proposal by proposition in a step (aO) before each proposal is in turn cut into words.
  • aO a step
  • the breakdown by propositions can be done following a division by sentences, itself after a division by sections.
  • the identification of words is done through spaces.
  • a parser (the parsing engine) using punctuation and formatting as a delimiter of the propositions may suffice if the punctuation is respected.
  • a text is classified in one or more "categories” according to the meaning it bears. Categories are here moving sets.
  • a category is represented by a list of themes.
  • the engine comprises three pistons connected to a crankshaft by star-shaped rods forming an angle of 120 ° two by two which reacts to the slightest pressure on the accelerator pedal ", or slight variation of this proposal.
  • step (b) at least one theme is identified among the plurality of themes each associated with a list of reference words of the stored theme.
  • a reference word associated with the theme is present for the theme to be associated.
  • at least two (or more) words are required.
  • the set of words of the part of the analyzed text associated with at least one theme is also identified. This is ⁇ engine, piston, crankshaft, connecting rod, pedal, angle, 120 °, star ⁇
  • V be a vocabulary of Nv words (in particular the set of reference words of at least one theme).
  • T be a subset of V of Nt words (in particular all of the reference words present in at least one theme), Nt ⁇ Nv.
  • P (P) and P (Q) are unitary commutative rings provided with two operators:
  • a symmetric difference operator denoted ⁇ (relative to two sets A and B, the symmetrical difference of A and B being the set containing the elements contained in A but not in B, and the elements contained in B and not in A) ; and - an intersection operator noted &.
  • P (P) is isomorphic to Z / NpZ and P (Q) is isomorphic to Z / NqZ
  • V A e P (P), P (A) is included in P (P) and A is also a unitary commutative ring.
  • A contains all the complete or partial combinations of a group of words.
  • A a "semantic ring". From the set of words of a proposition belonging to a theme, a semantic ring is defined by a subset of this set.
  • each ring is not the simple list of words that compose it, but rather the set of sets including i G HO, Kj of these words (which are other semantic rings).
  • the ring defined by vehicle and large actually corresponds to the set ⁇ ; ⁇ vehicle ⁇ ; ⁇ big ⁇ ⁇ vehicle, large ⁇ .
  • a ring is said centered if it does not exist two words that it contains belonging to two different thematics (but it can contain words not belonging to any thematic).
  • the method comprises constructing a plurality of subsets of the set of words of said part of the text associated with at least one theme, in other words the rings semantics, and advantageously the method comprises the construction of all of these rings.
  • step (d) a representation of the "meaning” of the semantic rings of a part of the text (which as explained is typically a proposition) is determined by the data processing means 1 1 of the equipment 1.
  • This representation takes the form of a matrix of vectors attached to the themes and comprising several dimensions and stored in the data storage means 12 of the equipment. This matrix is called “semantic matrix" (or sense matrix).
  • semantic matrix or sense matrix.
  • a sequence of semantic matrices is determined, and in a step (eO) a global semantic matrix of the text is determined according to the semantic matrices of the rings of the propositions.
  • a semantic matrix comprises at least two dimensions, advantageously three or even four: the coverage, the relevance (at least one of these two is required), the certainty, the nuance (the last two can be grouped into one dimension, the orientation).
  • the overall matrix of a text may include a fifth dimension (divergence).
  • the method comprises for each subgroup (ie semantic ring) and each identified theme, the calculation in a coverage coefficient of the theme and / or a relevance coefficient of the theme (advantageously both), depending of occurrences in the ring of reference words associated with the theme.
  • the coverage coefficient of a theme materializes the proximity between the ring and the theme, and is represented by an integer, typically the number N of words of the theme included in the ring. It is possible to add weightings (for example to certain "essential" words of the theme).
  • the coefficient of relevance is calculated by the data processing means 1 1 as the coverage coefficient but taking into account the total number of occurrences of the words of the theme.
  • N is the number of words of the theme contained in the ring, or each word counts only once (in other words the coverage coefficient of the theme) and R is the number of words of the theme contained in the ring, where each word counts as many times as it appears in the proposition (number of total occurrence, which increases with the length of the proposition)
  • the coefficient of relevance is for example given by the formula N * (1 + ln (#)), with In the natural logarithm.
  • Coefficient of certainty of a theme also comprises calculating, for each subgroup (ie semantic ring) and each identified theme, at least one orientation coefficient of the theme from the words of said part of the text that is not part of the ring (especially those not belonging to any ring).
  • two orientation coefficients of the theme are calculated in step (d), including a certainty coefficient of the theme and a coefficient of nuance of the theme.
  • Certainty is conveyed by a set of words whose order and nature can radically change the meaning of the proposition. These are typically words such as negations, punctuation, interrogative / negative words, a list of which can be stored on the data storage means 12. The position of these words relative to each other (typical of certain turns) gives besides indices on the certainty.
  • proximity can be affirmative, negative or uncertain.
  • the proximity is affirmative (for lack of words modifying the certainty).
  • the nuance is conveyed by a set of words whose order and nature can alter the meaning of the proposition.
  • This alteration can be a reinforcement or a weakening of the proximity with the theme, for example thanks to adverbs such as "certainly”, “assuredly”, “probably”, “possibly”.
  • adverbs such as "certainly”, “assuredly”, “probably”, “possibly”.
  • the data processing means 1 1 compare the words not associated with the theme with this list and deduce the value of the hue coefficient, which is in particular a positive scalar (greater than 1 for a reinforcement and less than 1 for a weakening )
  • each word representative of a shade can be stored associated with a coefficient, the coefficient of shade for the proposition being for example the product of the coefficients of the words found in the proposal.
  • the shade coefficient for the proposition can be the sum of the coefficients of the words found in the proposition.
  • the shading and certainty coefficients can constitute two distinct dimensions of the semantic matrix, or can be treated together as an orientation coefficient ("the orientator").
  • the semantic matrix obtained preferably has a structure of the type
  • a step (eO) the semantic matrices of a ring are combined into a global matrix: is computed by the data processing means 1 1 for each ring and each theme identified for at least one proposition of the text a global coefficient of coverage of the theme and / or of an overall coefficient of relevance of the theme, and of at least one overall orientation coefficient of the theme as a function of all of said coefficients associated with a proposition.
  • the matrices of two propositions are complementary if they relate to different themes.
  • the meaning matrix of the set of two propositions consists of the juxtaposition of the two matrices (since no theme is common).
  • the matrices of two propositions are coherent if they relate to common themes with similar orientators.
  • the matrices of two propositions are opposed if they relate to common themes with opposite orientators (of different signs, i.e. the difference relates to the coefficient of certainty of the theme).
  • an overall coefficient of relevance of a theme is calculated as the sum of the relevance coefficients of the theme associated with a proposition (since multiple occurrences are taken into account);
  • an overall orientation coefficient of a theme is calculated as the average of the orientation coefficients of the theme associated with a proposition weighted by the associated thematic coverage coefficients.
  • OS (OA * CA + OB * CB) / CS
  • thematic divergence is defined as representing the variations of meaning for a theme in a text.
  • the step (eO) thus comprises for each theme the calculation of an overall coefficient of divergence of the theme. It is calculated, for example, as the standard deviation of the distribution of the products of the advisers by the covers of the relevant proposals, brought back to the holistic product of the supplier by the coverage of the global text.
  • a text with strong divergence is a text in which the subject carried by the theme is approached with questions, comparisons, confrontations.
  • a low-divergence text is a text that constantly presents the same angle of view.
  • semantic coefficient representative of a degree of meaning carried by the subgroup according to said coverage coefficients, relevance and / or orientation of the theme, in particular the global coefficients.
  • This coefficient is calculated by the data processing means in step (e) of the method.
  • VAGP (P), with TGP (V), M (A, T) relevance (A, T) * orientator (A, T) * [1 + divergence (A, T) 2 ]
  • M (A, T) is the semantic coefficient of the ring A of the proposition P with respect to the theme T according to the vocabulary V.
  • M (A) is the semantic coefficient of the ring A of the proposition P with respect to all the themes according to the vocabulary V.
  • VAGP (P), with TGP (V), M (A, T) [relevance (A, T)] 2 * orientator (A, T), or
  • VAGP (P), with TGP (V), M (A, T) relevance (A, T) * neck under re (A, T)
  • the semantic coefficient makes it possible to select rings / thematic couples most meaningful in a step (f). In particular, it may be those for which the coefficient is the highest, but alternatively we can use the criterion of "growth" semantic rings.
  • a semantic ring increasing according to M any element A of P (Q) for which:
  • a growing semantic ring is a ring carrying a meaning greater than the sum of the meanings of its parts.
  • the sum of the semantic coefficients of the parts of the ring partition with respect to this theme is less than the semantic coefficient of the entire ring with respect to this theme.
  • the subset / thematic pairs selected in step (f) are those for which the ring is increasing for this theme.
  • this vehicle is big and blue
  • the rings ⁇ vehicle, big ⁇ and ⁇ vehicle, blue ⁇ carry less meaning than the global ring ⁇ vehicle, big, blue ⁇ . The latter is growing.
  • the union of two decreasing semantic rings is a descending semantic ring.
  • the union of a descending semantic ring and a growing semantic ring is a descending semantic ring.
  • the union of two increasing semantic rings is a semantic ring either increasing or decreasing.
  • the growing character is recessive to the union.
  • An expressive semantic ring is a set of words with a cultural meaning superior to that of the union of its parts.
  • this vehicle is a real bomb
  • the expressive ring ⁇ vehicle, bomb ⁇ associated with a reinforcing shade carries an expressive meaning not present in singletons rings ⁇ vehicle ⁇ and ⁇ bomb ⁇ and not present in the descending ring ⁇ vehicle, bomb ⁇ .
  • An expressive ring A is a descending ring that has become larger by a shade enhancement (ie, because of a high degree of shade due to the presence of "true” leading to a high orientation). Morphism M then has a discontinuity in the vicinity of A.
  • step (f) certain filters can eliminate certain rings according to a parameterization of the engine.
  • the first part which corresponds to the steps (a) to (f) already described, is implemented by a block called the analyzer for selecting rings / thematic couples representative of the meaning of the text.
  • a classifier associates the categories with the texts using the selected rings.
  • the categories corresponding groups of couples subset / thematic reference are stored on the data storage means 12, and the categories in which the text is classified are those comprising at least a subset / thematic couple selected at the step (f).
  • Step (g) may thus comprise the calculation of a so-called dilution coefficient, which represents the number of occurrences of terms of the themes related to the determined category or categories (in other words the themes of the pairs of the associated groups). to the categories), present in the text compared to the total number of terms of the said themes. It is said that the text is of category X according to dilution D.
  • the categories are not fixed and can evolve. In particular new categories can be generated and others segmented.
  • a new category can be generated with a new meaning: a new group is created if no subset / thematic group of couples of reference contains at least a subset / thematic couple selected for the text. The subset / thematic couples become the reference ones of this group.
  • each reference subset / thematic pair may be associated with a score stored on the data storage means 12, the score of a reference subassembly / thematic pair diminishing over time (for example, by damping hyperbolic) but increasing each time this subset / thematic couple is selected for a text.
  • the method may then comprise a step (h) of deleting a subassembly / thematic reference pair of a group if the score of said pair falls below a first threshold, or of modification on the storage means 12 of said plurality of lists associated with the themes if the score of said pair passes above a second threshold.
  • the connectivity between a ring and a theme can indeed be represented by a coefficient representing for each theme the frequency of appearance of this theme among the topics such that the pair ring / thematic associated has already been selected.
  • the connectivity between a ring and a theme is for example given as the score of this ring / thematic couple on the sum of the scores associated with pairs of this ring with a reference theme.
  • a strongly eroded ring (score passing below the first threshold) disappears from the stack.
  • Both thresholds can be set manually according to the "sensitivity", that is, the desired level of scalability of the system. Close thresholds (first high threshold and / or second low threshold) lead to a strong renewal of themes and categories.

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Computational Linguistics (AREA)
  • Artificial Intelligence (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • General Health & Medical Sciences (AREA)
  • Health & Medical Sciences (AREA)
  • Data Mining & Analysis (AREA)
  • Databases & Information Systems (AREA)
  • Machine Translation (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)

Abstract

La présente invention concerne le domaine de la compréhension sémantique par ordinateur. Plus précisément elle concerne un procédé d'analyse sémantique d'un texte en langage naturel par des moyens de traitement de données, en vue de sa classification.

Description

Procédé d'analyse sémantique d'un texte
DOMAINE TECHNIQUE GENERAL La présente invention concerne le domaine de la compréhension sémantique par ordinateur.
Plus précisément elle concerne un procédé d'analyse sémantique d'un texte en langage naturel par des moyens de traitement de données, en vue de sa classification.
ETAT DE L'ART
L'analyse sémantique d'un texte en langage naturel vise à en établir la signification en utilisant le sens des mots qui le constituent, suite à une analyse lexicale qui permet de décomposer ce texte à l'aide d'un lexique ou d'une grammaire. L'humain le réalise inconsciemment pour comprendre les textes qu'il lit, et des développements récents visent à conférer des capacités semblables aux machines.
On connaît pour le moment des algorithmes d'analyse sémantique automatisée conçus pour qu'un ordinateur puisse classer un texte dans plusieurs catégories prédéterminées, par exemple des thèmes généraux tels que « nature », « économie », « littérature », etc.
Toutefois, cette classification s'avère très limitée et peu évolutive. Dans la mesure où le choix des diverses catégories possible est souvent arbitraire, des textes situés à la frontière de deux catégories peuvent poser problème aux algorithmes. De plus, classifier plus finement dégrade fortement les performances des algorithmes et entraîne des erreurs d'appréciation, causées notamment par les ambiguïtés dues à certains homonymes et certaines tournures (par exemple une double négation).
De façon générale, donner par un traitement informatique un sens
« absolu » à un texte est une opération très complexe et souvent contestable. Par exemple, déterminer si un texte prend position « pour » ou « contre » une opinion est aujourd'hui hors de portée de l'analyse sémantique informatisée.
Il serait souhaitable de disposer d'un procédé amélioré d'analyse sémantique d'un texte par un ordinateur en vue de sa classification qui soit significativement plus performant et plus fiable que tout ce qui fait actuellement, et qui ne soit pas limité par des modèles sémantiques préétablis.
PRESENTATION DE L'INVENTION
La présente invention propose un procédé d'analyse sémantique d'un texte en langage naturel reçu par un équipement depuis des moyens de saisie, le procédé étant caractérisé en ce qu'il comprend la mise en œuvre par des moyens de traitement de données de l'équipement d'étapes de :
(a) Découpage syntaxique d'au moins une partie du texte en une pluralité de mots ;
(b) Filtrage des mots de ladite partie de texte par rapport à une pluralité de liste de mots de référence stockées sur des moyens de stockage de données de l'équipement chacune étant associée à une thématique, de sorte à identifier :
• L'ensemble des mots de ladite partie du texte associés à au moins une thématique,
• L'ensemble des thématiques de ladite partie du texte ;
(c) Construction d'une pluralité de sous-ensembles de l'ensemble des mots de ladite partie du texte associés à au moins une thématique ;
(d) Pour chacun desdits sous-ensembles et pour chaque thématique identifiée, calcul :
• d'un coefficient de couverture de la thématique et/ou d'un coefficient de pertinence de la thématique en fonction d'occurrences dans ladite partie du texte de mots de référence associés à la thématique ; • d'au moins un coefficient d'orientation de la thématique à partir des mots de ladite partie du texte ne faisant pas partie du sous-ensemble ;
(e) Pour chacun desdits sous-ensembles et pour chaque thématique identifiée, calcul d'un coefficient sémantique représentatif d'un degré de sens porté par le sous-groupe en fonction desdits coefficients de couverture, pertinence et/ou orientation de la thématique.
(f) Sélection en fonction des coefficients sémantiques d'au moins un couple sous-ensemble/thématique.
(g) Classification du texte en fonction dudit au moins un couple sous- ensemble/thématique sélectionné.
Selon d'autres caractéristiques avantageuses et non limitatives de l'invention :
· un coefficient de couverture d'une thématique est calculé à l'étape (d) comme le nombre N de mots de référence associés à la thématique compris dans ledit sous-ensemble ;
• un coefficient de pertinence d'une thématique est calculé à l'étape (d) par la formule N * (1 + ln(#)), où N est le nombre de mots de référence associés à la thématique compris dans le sous-ensemble et R le nombre total d'occurrences dans ladite partie du texte de mots de référence associés à la thématique ;
• deux coefficients d'orientation de la thématique sont calculés à l'étape (c), dont un coefficient de certitude de la thématique et un coefficient de nuance de la thématique ;
• un coefficient de certitude d'une thématique est calculé à l'étape (d) comme valant :
- 1 si les mots ne faisant pas partie du sous-ensemble sont représentatifs d'une proximité affirmative avec la thématique ;
- -1 si les mots ne faisant pas partie du sous-ensemble sont représentatifs d'une proximité négative avec la thématique ; - 0 si les mots ne faisant pas partie du sous-ensemble sont représentatifs d'une proximité incertaine avec la thématique ;
• un coefficient de nuance d'une thématique est un scalaire positif supérieur à 1 lorsque les mots ne faisant pas partie du sous-ensemble sont représentatifs d'une amplification de la thématique, et un scalaire positif inférieur à 1 lorsque les mots ne faisant pas partie du sous-ensemble sont représentatifs d'une atténuation de la thématique ;
• le procédé comprend une étape (aO) préalable de découpage du texte en une pluralité de proposition, chacune étant une partie du texte pour laquelle les étapes (a) à (d) du procédé selon répétées de sorte à obtenir pour chaque proposition un ensemble de coefficients de couverture, de pertinence, et/ou d'orientation associés à la proposition, le procédé comprenant préalablement à l'étape (e) une étape (eO) de calcul pour chacun desdits sous-ensemble et pour chaque thématique identifiée pour au moins une proposition du texte d'un coefficient global de couverture de la thématique et/ou d'un coefficient global de pertinence de la thématique, et d'au moins un coefficient global d'orientation de la thématique en fonction de l'ensemble desdits coefficients associés une proposition ;
• un coefficient global de couverture d'une thématique est calculé à l'étape (eO) comme la somme des coefficients de couverture de la thématique associée à une proposition moins le nombre de mots de référence de la thématique présents dans au moins deux propositions ;
• un coefficient global de pertinence d'une thématique est calculé à l'étape (eO) comme la somme des coefficients de pertinence de la thématique associée à une proposition ;
• un coefficient global d'orientation d'une thématique est calculé à l'étape (eO) comme la moyenne des coefficients d'orientation de la thématique associés à une proposition pondérés par les coefficients de couverture de la thématique associés ;
· l'étape (eO) comprend pour chacun desdits sous-ensembles et pour chaque thématique le calcul d'un coefficient global de divergence de la thématique correspondant à l'écart-type de la distribution des produits des coefficients d'orientation par les coefficients de couverture associés à chaque proposition ;
• un coefficient sémantique d'un sous-ensemble A pour une thématique T est calculé à l'étape (e) par la formule M(A,T) = coefficient de pertinence(A,T) * coefficient d'orientation(A,T) * [1 + coefficient de divergence(A,T)2] ;
• les couples sous-ensemble/thématique sélectionnés à l'étape (f) sont ceux tels que pour toute partition du sous-ensemble en une pluralité de parties dudit sous-ensemble, le coefficient sémantique du sous-ensemble pour la thématique est supérieur à la somme des coefficients sémantiques des sous-parties du sous-ensemble pour la thématique ;
• des groupes de couples sous-ensemble/thématique de référence sont stockés sur les moyens de stockage de données, l'étape (g) comprenant la détermination du ou des groupes comprenant au moins un couple sous- ensemble/thématique sélectionné à l'étape (f) ;
• l'étape (g) comprend la création d'un nouveau groupe si aucun groupe de couples sous-ensemble/thématique de référence ne contient au moins un couple sous-ensemble/thématique sélectionné pour le texte ;
• chaque couple sous-ensemble/thématique de référence est associé à un score stocké sur les moyens de stockage de données, le score d'un couple sous-ensemble/thématique de référence diminuant avec le temps mais augmentant à chaque fois que ce couple sous-ensemble/thématique est sélectionné pour un texte ;
• le procédé comprend une étape (h) de suppression d'un couple sous- ensemble/thématique de référence d'un groupe si le score dudit couple passe en dessous d'un premier seuil, ou de modification sur les moyens de stockage de données (12) de ladite pluralité de listes associées aux thématiques si le score dudit couple passe au-dessus d'un deuxième seuil ;
• l'étape (g) comprend pour chaque groupe de couples sous- ensemble/thématique de référence le calcul d'un coefficient de dilution représentant le nombre d'occurrences dans ladite partie du texte de mots de référence associés à des thématiques des couples sous- ensemble/thématique de référence présents dans le texte rapporté au nombre total de mots de référence associés auxdites thématiques ;
• tous les sous-ensembles de l'ensemble des mots de ladite partie du texte associés à au moins une thématique sont construits à l'étape (c).
Selon un deuxième aspect, l'invention concerne un équipement comprenant des moyens de traitement de données configurées pour mettre en œuvre suite à la réception d'un texte en langage naturel un procédé selon le premier aspect de l'invention d'analyse sémantique du texte.
BREVE DESCRIPTION DES FIGURES
D'autres caractéristiques et avantages de la présente invention apparaîtront à la lecture de la description qui va suivre d'un mode de réalisation préférentiel. Cette description sera donnée en référence aux dessins annexés dans lesquels :
- la figure 1 est un schéma d'une architecture réseau dans laquelle s'inscrit l'invention ;
- la figure 2 est un diagramme représentant schématiquement les étapes du procédé d'analyse sémantique selon l'invention.
DESCRIPTION DETAILLEE D'UN MODE DE REALISATION PREFERE Architecture
En référence à la figure 1 , le présent procédé est mis en œuvre par des moyens de traitement de données 1 1 (qui consistent typiquement en un ou plusieurs processeurs) d'un équipement 1 . Ce dernier peut être par exemple un ou plusieurs serveurs connectés à un réseau 4, typiquement internet, via lequel il est relié à des clients 2 (par exemple des PC personnels). L'équipement 1 comprend en outre des moyens de stockage de données 12 (typiquement un ou plusieurs disques durs).
La notion de texte
Un texte est ici n'importe quel message en langage naturel et porteur de sens. Le texte est reçu sous forme électronique, c'est-à-dire en un format directement traitable par les moyens de traitement 1 1 , par exemple XML (extensible Markup Language). On comprendra que par reçu « depuis des moyens de saisie 14 », on entend une grande variété d'origines. De façon générale, le terme moyens de saisie désigne tout moyens, hardware et/ou software, permettant de récupérer le texte et de l'envoyer aux moyens de traitement de données 1 1 sous un format lisible. Le texte peut être directement tapé par un utilisateur, et les moyens de saisie 14 désignent par exemple un clavier et un logiciel de traitement de texte. Alternativement, le texte peut être un texte papier scanné et reconnu par OCR (reconnaissance optique de caractères), et les moyens de saisie 14 désignent alors un scanner et un logiciel de traitement des données numérisées, ou encore le texte peut être dicté et les moyens de saisie 14 désignent alors un microphone et un logiciel de reconnaissance vocale. Enfin, le texte peut être reçu par exemple depuis un serveur du réseau internet, éventuellement directement sous un format lisible. Le présent procédé n'est limité à aucun type de texte. Dans une structure connectée du type de la figure 1 , les moyens de saisie sont typiquement ceux d'un client 2 ou un autre serveur 1 .
Le texte est structuré en sections. Les sections peuvent être séparées par des paragraphes ou êtres simplement enchaînées. Les sections se distinguent les unes des autres par le fait que les concepts exposés sont sensiblement différents. La détection des sections non marquées par l'auteur est une opération complexe. Une section est composée de phrases séparées par une ponctuation (deux points, point, point d'exclamation, point d'interrogation, tiret d'alinéa, points de suspension, etc.).
Une phrase est composée de propositions séparées par une ponctuation (virgule, point-virgule).
Une proposition est une suite de mots séparés par des espaces.
Un mot est un ensemble ordonné de lettres et de signes particuliers (accents, tirets, etc.).
Dans certains textes, les ponctuations peuvent ne pas être respectées. Certains textes peuvent contenir des mots abrégés ou des mots éludés.
Dans une première étape (a), dite de « parsing », au moins une partie du texte est découpée syntaxiquement en une pluralité de mots. Avantageusement, cette partie de phrase est une proposition, et le texte est d'abord découpé proposition par proposition dans une étape (aO) avant que chaque proposition soit tour à tour découpée en mots. On connaît des algorithmes capables, notamment grâce à des règles de grammaire, d'identifier les propositions. Le découpage par propositions peut se faire suite à un découpage par phrases, lui-même après un découpage par sections. L'identification des mots se fait grâce aux espaces.
Typiquement, un parseur (le moteur mettant en œuvre le parsing) utilisant la ponctuation et la mise en forme comme délimiteur des propositions peut suffire si les ponctuations sont respectées.
Au sein d'une proposition, l'homme du métier utilisera par exemple un parseur mettant en œuvre les règles suivantes :
- remplacement de chaque verbe par ce verbe à l'infinitif et association à ce dernier de trois indices (le mode, le temps, la personne) ;
- remplacement de chaque nom par ce nom au singulier et association à ce dernier de deux indices (le genre, le nombre) ;
- remplacement de chaque adjectif par cet adjectif au masculin singulier et association à ce dernier de deux indices (le genre, le nombre) ; - conservation des adverbes ;
- suppressions des mots « enjoliveurs » de la langue (à l'aide d'une liste) ;
- déclaration comme nom propre de tout autre terme ;
- inscription de chaque mot, son type et ses indices dans une liste associée à la proposition.
Les présentes règles peuvent être modifiées ou supprimées, d'autres règles peuvent enrichir le parseur. La notion de catégories et thématiques
Un texte se classe dans une ou plusieurs « catégories » en fonction du sens qu'il porte. Les catégories sont ici des ensembles mouvants.
Comme l'on verra plus loin, les catégories sont définies comme des groupes « d'anneaux » et peuvent être induites par l'apparition d'un texte relevant d'un sens nouveau.
Lorsqu'une catégorie devient trop peuplée il est souhaitable de la segmenter en réduisant le spectre des sens admissibles dans chaque groupe de textes formés par la scission de la catégorie initiale. Chaque groupe de texte devient alors une catégorie. Une catégorie se représente par une liste de thématiques.
Le thème est le sens est attaché à un ensemble de mots (dits mots de référence) entrant dans la composition d'une proposition, présents dans une liste appelée thématique. La thématique est attachée à une ou plusieurs catégories.
Pour chaque thématique, la liste des mots de référence associée est stockée sur les moyens de stockage 12 de l'équipement 1 .
Par exemple, une thématique « motorisation » peut comprendre des mots de référence {moteur, piston, cylindre, vilebrequin, arbre, bielle, pédale, puissance, etc.}, et une thématique « géométrie » peut comprendre les mots de référence {droite, angle, degré, étoile, rectangle, sphère, cylindre, pyramide, etc.}. On voit notamment que le mot « cylindre » présente plusieurs sens et est ainsi lié aux deux thématiques bien qu'elles soient éloignées.
Dans la suite de la présente description, on prendra l'exemple d'une proposition formulée comme suit : « le moteur comprend trois pistons reliés à un vilebrequin par des bielles en étoile formant un angle de 120° deux à deux qui réagit à la moindre pression sur la pédale d'accélération », ou de légères variation de cette proposition.
Dans l'étape (b), au moins une thématique est identifiée parmi la pluralité de thématiques chacune associées à une liste de mots de référence de la thématique stockée.
En particulier, il suffit qu'un mot de référence associé à la thématique soit présent pour que la thématique soit associée. Alternativement, au moins deux (voire plus) mots sont requis.
Dans notre exemple :
- le groupe de mots {moteur, piston, vilebrequin, bielle, pédale} permet de détecter une thématique « motorisation »
- le groupe de mots {angle, 120°, étoile} permet de détecter une thématique « géométrie ».
L'ensemble des mots de la partie du texte analysée associés à au moins une thématique est également identifié. Il s'agit ici de {moteur, piston, vilebrequin, bielle, pédale, angle, 120°, étoile}
Anneaux sémantiques Soit V un vocabulaire de Nv mots (en particulier l'ensemble des mots de référence d'au moins une thématique).
Soit T un sous ensemble de V de Nt mots (en particulier l'ensemble des mots de référence présents dans au moins une thématique), Nt≤ Nv.
Soit P une proposition de Np mots, telle que Np≤ Nv.
Soit Q le groupe de Nq mots communs à P et à T (il s'agit des mots de la proposition appartenant à au moins une thématique), Nq≤ Np. Soit P(P) l'ensemble des parties de P et P(Q) l'ensemble des parties de Q.
Par construction, P(P) et P(Q) sont des anneaux commutatifs unitaires munis de deux opérateurs :
- un opérateur de différence symétrique noté Δ (relativement à deux ensembles A et B, la différence symétrique de A et B est l'ensemble contenant les éléments contenus dans A mais pas dans B, et les éléments contenus dans B et pas dans A) ; et - un opérateur d'intersection noté &.
P(P) est isomorphe à Z/NpZ et P(Q) est isomorphe à Z/NqZ
V A e P(P), P(A) est inclus dans P(P) et A est aussi un anneau commutatif unitaire. A contient toutes les combinaisons complètes ou partielles d'un groupe de mots. On appelle A un « anneau sémantique ». A partir de l'ensemble des mots d'une proposition appartenant à une thématique, un anneau sémantique est défini par un sous-ensemble de cet ensemble.
Par exemple, si « ce véhicule est grand et bleu » est une proposition, les anneaux sémantiques de cette proposition sont notés {}, {véhicule}, {grand}, {bleu}, {véhicule, grand}, {véhicule, bleu}, {véhicule, grand, bleu}. Il est important de comprendre que chaque anneau n'est pas la simple liste des mots qui le compose, mais bien l'ensemble des ensembles comprenant i G HO, Kj de ces mots (qui sont d'autres anneaux sémantiques). Par exemple, l'anneau défini par véhicule et grand correspond en réalité à l'ensemble { {} ; {véhicule} ; {grand} ; {véhicule, grand} }.
Un anneau est dit centré s'il n'existe pas deux mots qu'il contienne appartenant à deux thématiques différentes (mais il peut contenir des mots n'appartenant à aucun thématique).
Un anneau est dit régulier s'il appartient aussi à P(Q), c'est-à-dire que tous les mots qu'il contient appartiennent à l'une des thématiques.
Dans une étape (c), le procédé comprend la construction d'une pluralité de sous-ensembles de l'ensemble des mots de ladite partie du texte associés à au moins une thématique, en d'autres termes les anneaux sémantiques réguliers, et avantageusement le procédé comprend la construction de la totalité de ces anneaux.
Si l'ensemble des mots associés à au moins une thématique comprend K éléments, alors il y a 2K anneaux construits.
Matrices sémantiques
Dans l'étape (d), une représentation du « sens » des anneaux sémantique d'une partie du texte (qui comme expliqué est typiquement une proposition) est déterminée par les moyens de traitement de données 1 1 de l'équipement 1 . Cette représentation prend la forme d'une matrice formée de vecteurs attachés aux thématiques et comprenant plusieurs dimensions et stockée dans les moyens de stockage de données 12 de l'équipement. Cette matrice est appelée « matrice sémantique » (ou matrice de sens). Dans l'hypothèse d'un traitement proposition par proposition, une suite de matrices sémantiques est déterminée, et dans une étape (eO) une matrice sémantique globale du texte est déterminée en fonction des matrices sémantiques des anneaux des propositions.
Une matrice sémantique comprend au moins deux dimensions, avantageusement trois, voire quatre : la couverture, la pertinence (au moins une parmi ces deux est requise), la certitude, la nuance (les deux dernières peuvent être regroupées en une seule dimension, l'orientation). La matrice globale d'un texte peut comprendre une cinquième dimension (la divergence).
Coefficient de couverture d'une thématique
Le procédé comprend pour chaque sous-groupe (i.e. anneau sémantique) et chaque thématique identifiée, le calcul dans d'un coefficient de couverture de la thématique et/ou d'un coefficient de pertinence de la thématique (avantageusement les deux), en fonction d'occurrences dans l'anneau de mots de référence associés à la thématique. Le coefficient de couverture d'une thématique matérialise la proximité entre l'anneau et la thématique, et se représente par un nombre entier, typiquement le nombre N de mots de la thématique compris dans l'anneau. Il est possible d'adjoindre des pondérations (par exemple à certains mots « essentiels » de la thématique).
Dans l'exemple précédent, la proximité entre la proposition et la thématique « motorisation » est plus forte que celle avec la thématique « géométrie » (coefficient de cinq contre trois). Coefficient de pertinence d'une thématique
Le coefficient de pertinence est calculé par les moyens de traitement de données 1 1 comme le coefficient de couverture mais en prenant en compte le nombre total d'occurrence des mots du thème.
En particulier, si N est le nombre de mots de la thématique contenus dans l'anneau, ou chaque mot ne compte qu'une fois (en d'autres termes le coefficient de couverture de la thématique) et R est le nombre de mots de la thématique contenus dans l'anneau, ou chaque mot compte autant de fois qu'il apparaît dans la proposition (nombre d'occurrence total, qui croit avec la longueur de la proposition), le coefficient de pertinence est par exemple donné par la formule N * (1 + ln(#)), avec In le logarithme népérien.
Le calcul d'un coefficient de pertinence n'est pas limité à cette formule, et l'homme du métier pourra par exemple utiliser les formules h(^) avec ch le cosinus hyperbolique, ou encore ^ * atan(^) avec atan l'arc tangente, selon le nombre et la taille des thématiques existantes. Chacune de ces formules peut être normalisée.
L'utilisation de l'arc tangente amortit l'effet des grandes valeurs de R, alors qu'on contraire le cosinus hyperbolique accentue l'effet des grandes valeurs de R.
Coefficient de certitude d'une thématique Le procédé comprend également le calcul, toujours pour chaque sous-groupe (i.e. anneau sémantique) et chaque thématique identifiée, d'au moins un coefficient d'orientation de la thématique à partir des mots de ladite partie du texte ne faisant pas partie de l'anneau (en particulier ceux n'appartenant à aucun anneau).
En particulier, deux coefficients d'orientation de la thématique sont calculés à l'étape (d), dont un coefficient de certitude de la thématique et un coefficient de nuance de la thématique.
La certitude est véhiculée par un ensemble de mots dont l'ordre et la nature peut changer radicalement le sens porté par la proposition. Il s'agit typiquement des mots tels que des négations, de la ponctuation, des mots interrogatifs/négatifs, dont une liste peut être stockée sur les moyens de stockage de données 12. La position de ces mots les uns par rapport aux autres (typique de certaines tournures) donne par ailleurs des indices sur la certitude.
Selon ces mots, la proximité peut être affirmative, négative ou incertaine. Dans l'exemple précédent, la proximité est affirmative (faute de mots modifiant la certitude).
Par comparaison, dans une proposition qui serait formulée « aucun moteur ne comprenant aucune bielle ni aucun piston n'équipe ce véhicule à pédale », la motorisation est une anti-thématique, révélée par les mots répétés « aucun(e) », « ni » et « n' ».
La proximité entre ce texte et la thématique « motorisation » est négative.
Par comparaison encore, dans l'exemple : « ce véhicule serait-il équipé d'un moteur à piston et d'un vilebrequin à bielles ? », la proximité entre le texte et la catégorie « motorisation » est interrogative du fait de la tournure interrogative et la présence du point d'interrogation.
La certitude peut ainsi se représenter par trois valeurs :
1 pour l'affirmative -1 pour la négative
0 pour l'incertitude (interrogatif, interronégatif, affirmatif et négatif entremêlés, etc.) Coefficient de nuance d'une thématique
La nuance est véhiculée par un ensemble de mots dont l'ordre et la nature peut altérer le sens porté par la proposition. Cette altération peut être un renforcement ou un affaiblissement de la proximité avec la thématique, par exemple grâce à des adverbes tels que « certainement », « assurément », « probablement », « éventuellement ». Comme pour la nuance, il est possible de stocker sur les moyens de stockage 12 une liste des mots caractéristiques d'un renforcement ou d'un affaiblissement de la proximité avec une thématique. Les moyens de traitement de données 1 1 comparent les mots non associés avec la thématique avec cette liste et en déduisent la valeur du coefficient de nuance, qui est en particulier un scalaire positif (supérieur à 1 pour un renforcement et inférieur à 1 pour un affaiblissement)
Dans l'exemple : « Assurément ce moteur comprend bien un vilebrequin et des bielles, » la nuance est un renforcement de la thématique (grâce à « assurément »), et le coefficient est par exemple 1 .5.
Dans l'exemple : « Matthieu croit savoir que le moteur contient un vilebrequin et des bielles, » la nuance est un affaiblissement de la thématique (grâce à « croire »), et le coefficient est par exemple 0.75.
II est à noter que chaque mot représentatif d'une nuance peut être stocké associé à un coefficient, le coefficient de nuance pour la proposition étant par exemple le produit des coefficients des mots trouvés dans la proposition. Alternativement, le coefficient de nuance pour la proposition peut être la somme des coefficients des mots trouvés dans la proposition.
Le tableau ci-dessous donne deux exemples d'ensembles de coefficients de quelques mots porteurs de nuances, aussi bien dans une composition par produit (colonne de gauche) que par somme (colonne de droite). On comprendra que l'invention n'est limitée à aucun mode de calcul du coefficient de nuance.
Figure imgf000017_0001
Coefficient d'orientation d'une thématique
Les coefficients de nuance et de certitude peuvent constituer deux dimensions distinctes de la matrice sémantique, ou être traitées ensemble comme un coefficient d'orientation (« l'orienteur »).
II est peut être calculé comme le produit des coefficients de certitude et de nuance. En effet, ces deux concepts sont indépendants. La proximité à une thématique peut par exemple être renforcée dans le négatif par une formulation telle que « le véhicule ne comprend certainement pas de moteur », qui correspondra par exemple a un coefficient de -1 .75
Le coefficient d'orientation est ainsi typiquement un nombre réel :
< 0 pour la certitude négative
> 0 pour la certitude affirmative
0 pour l'incertitude
Et dont la valeur absolue est
> 1 pour un renforcement
< 1 pour une relativisation
=1 pour une orientation neutre
A l'issue de l'étape (d), la matrice sémantique obtenue a préférentiellement une structure du type
Thème 1 Thème 2 Thème 3 Thème i
Couverture 1 Couverture 2 Couverture 3 Couverture i
Pertinence 1 Pertinence 2 Pertinence 3 Pertinence i
Orienteur 1 Orienteur 2 Orienteur 3 Orienteur i Composition de matrices sémantiques Comme expliqué plus haut, un texte est formé de plusieurs phrases formées elles-mêmes de plusieurs propositions. Une matrice sémantique est avantageusement générée pour un anneau pour chaque proposition.
Dans une étape (eO), les matrices sémantiques d'un anneau sont combinées en une matrice globale : est calculé par les moyens de traitement de données 1 1 pour chaque anneau et chaque thématique identifiée pour au moins une proposition du texte un coefficient global de couverture de la thématique et/ou d'un coefficient global de pertinence de la thématique, et d'au moins un coefficient global d'orientation de la thématique en fonction de l'ensemble desdits coefficients associés une proposition.
Les matrices de deux propositions sont complémentaires si elles portent sur des thèmes différents. La matrice de sens de l'ensemble des deux propositions est constituée de la juxtaposition des deux matrices (puisqu'aucune thématique n'est commune).
Les matrices de deux propositions sont cohérentes si elles portent sur des thèmes communs avec des orienteurs similaires.
Les matrices de deux propositions sont opposées si elles portent sur des thèmes communs avec des orienteurs opposés (de signes différents, i.e. la différence porte sur le coefficient de certitude de la thématique).
Dans le cas général deux matrices A et B portent sur certains thèmes communs et sur d'autres différents. La matrice résultante S est alors composée d'une colonne par thème appartenant à l'une ou l'autre proposition.
Par exemple les règles suivantes peuvent s'appliquer à la composition de deux colonnes pour un même thème :
- un coefficient global de couverture d'une thématique est calculé comme la somme des coefficients de couverture de la thématique associée à une proposition moins le nombre de mots de référence de la thématique présents dans au moins deux propositions (en d'autres termes il ne faut compter qu'une fois chaque mot. La couverture de la somme est ainsi comprise entre la plus grande des couvertures (cas ou tous les mots de référence de la thématique trouvés dans une proposition sont également dans l'autre), et la somme (cas ou aucun mot de référence n'est commun aux deux couvertures thématiques). Il est à noter que le coefficient global de couverture peut être facilement recalculé comme le nombre Nmax ôe mots de la thématique contenus dans l'ensemble des propositions) ;
- un coefficient global de pertinence d'une thématique est calculé comme la somme des coefficients de pertinence de la thématique associée à une proposition (puisque les occurrences multiples sont prises en compte) ;
- un coefficient global d'orientation d'une thématique est calculé comme la moyenne des coefficients d'orientation de la thématique associés à une proposition pondérés par les coefficients de couverture de la thématique associés. Par exemple, le coefficient global d'orientation du texte S formé des propositions A et B est donné par la formule OS = (OA*CA + OB*CB) / CS
Par ailleurs, on définit la « divergence thématique » comme représentant les variations de sens pour une thématique dans un texte.
Avantageusement, l'étape (eO) comprend ainsi pour chaque thématique le calcul d'un coefficient global de divergence de la thématique. Il se calcule par exemple comme étant l'écart type de la distribution des produits des orienteurs par les couvertures des propositions concernées ramenée au produit holiste de l'o enteur par la couverture du texte global.
Un texte à forte divergence est un texte dans lequel le sujet porté par la thématique est abordé avec des interrogations, des comparaisons, des confrontations. Un texte à faible divergence est un texte présentant constamment le même angle de vue.
Anneaux sémantiques croissants et décroissants
La notion d'anneau sémantique croissant ou décroissant est relative à un morphisme, permettant de calculer un « coefficient sémantique », représentatif d'un degré de sens porté par le sous-groupe en fonction desdits coefficients de couverture, pertinence et/ou orientation de la thématique, en particulier les coefficients globaux.
Ce coefficient est calculé par les moyens de traitement de données à l'étape (e) du procédé.
Par exemple, soit M le morphisme de P(P)→ R tel que
V A G P(P), avec T G P(V), M(A,T) = pertinence(A,T) * orienteur(A,T) * [1 + divergence(A,T)2]
M(A,T) est le coefficient sémantique de l'anneau A de la proposition P par rapport à la thématique T selon le vocabulaire V.
M(A) est le coefficient sémantique de l'anneau A de la proposition P par rapport à toutes les thématiques selon le vocabulaire V.
Alternativement, sont possibles (en particulier dans un mode de réalisation ne comprenant pas le calcul d'un coefficient de divergence) des morphismes M tels que
V A G P(P), avec T G P(V), M(A,T) = [pertinence(A,T)]2 * orienteur(A,T), ou encore
V A G P(P), avec T G P(V), M(A,T) = pertinence(A,T) * cou vertu re(A,T)
Toutes ces formules peuvent également être normalisées.
Quelque soit le morphisme choisi, le coefficient sémantique permet de sélectionner des couples anneaux/thématique les plus porteurs de sens dans une étape (f). En particulier, ce peut être ceux pour lesquels le coefficient est le plus élevé, mais alternativement on peut utiliser le critère de « croissance » des anneaux sémantiques. On appelle anneau sémantique croissant selon M, tout élément A de P(Q) pour lequel :
V A' G P(A),
Ξ T, M(A,T) > M(A',T) + Μ(Α'ΔΑ,Τ)
- Avec cardinalité(A) > 1
En d'autres termes, un anneau sémantique croissant est un anneau porteur d'un sens plus grand que la somme des sens de ses parties. Pour reformuler encore, il existe une thématique telle que pour toute partition de l'anneau, la somme des coefficients sémantiques des parties de la partition de l'anneau par rapport à cette thématique est inférieure au coefficient sémantique de l'anneau entier par rapport à cette thématique.
Par opposition, les autres anneaux sémantiques sont dit décroissants.
Avantageusement, les couples sous-ensemble/thématique sélectionnés à l'étape (f) sont ceux pour lesquels l'anneau est croissant pour cette thématique.
Le choix du morphisme est déterminant pour sélectionner les anneaux sémantiques. Un morphisme trop lâche conduira à ce que tous les anneaux soit des anneaux sémantiques croissants. Un morphisme trop strict conduira à l'absence d'anneaux sémantiques croissants.
Pour illustrer cette notion d'anneaux croissants/décroissants, dans la proposition « ce véhicule est grand dedans et petit dehors », les anneaux {véhicule, grand} et {véhicule, petit} portent plus de sens que l'anneau global {véhicule, grand, petit}, puisque la présence simultanée des termes grand et petit fait baisser l'orienteur. L'anneau {véhicule, grand, petit} est donc décroissant.
Dans la proposition : « ce véhicule est grand et bleu », les anneaux {véhicule, grand} et {véhicule, bleu} portent moins de sens que l'anneau global {véhicule, grand, bleu}. Ce dernier est croissant.
L'union de deux anneaux sémantiques décroissants est un anneau sémantique décroissant. L'union d'un anneau sémantique décroissant et d'un anneau sémantique croissant est un anneau sémantique décroissant. L'union de deux anneaux sémantiques croissants est un anneau sémantique soit croissant, soit décroissant. Le caractère croissant est récessif vis-à-vis de l'union.
Un anneau sémantique expressif est un ensemble de mots porteur d'un sens culturel supérieur à celui de l'union de ses parties.
Par exemple dans l'expression : « ce véhicule est une vraie bombe », l'anneau expressif {véhicule, bombe} associée à une nuance de renforcement (« vraie ») porte un sens expressif non présent dans les anneaux singletons {véhicule} et {bombe} et non présent dans l'anneau décroissant {véhicule, bombe}.
Un anneau expressif A est un anneau décroissant devenu croissant par un renforcement de nuance (i.e. grâce à un coefficient de nuance élevé dû à la présence de « vraie » entraînant un orienteur élevé). Le morphisme M présente alors une discontinuité au voisinage de A.
II est à noter qu'avant même la mise en œuvre de l'étape (f), certains filtres peuvent éliminer certains anneaux selon un paramétrage du moteur.
Il est à noter qu'une notion de connexité entre anneaux et thématiques peut être surveillée par les moyens de traitement de données 1 1 . Un anneau fortement connexe à une thématique sera toujours sélectionné en couple avec cette thématique et jamais une autre (voir plus loin).
Classification du texte Un schéma global du procédé d'analyse sémantique selon l'invention est représenté par la figure 2.
La première partie, qui correspond aux étapes (a) à (f) déjà décrite, est mise en œuvre par un bloc appelé l'analyseur permettant de sélectionner les couples anneaux/thématiques représentatifs du sens du texte.
Dans une étape (g), un classificateur associe les catégories aux textes à l'aide des anneaux sélectionnés. En particulier, les catégories correspondent à des groupes de couples sous-ensemble/thématique de référence sont stockés sur les moyens de stockage de données 12, et les catégories dans lesquelles le texte est classifié sont celles comprenant au moins un couple sous-ensemble/thématique sélectionné à l'étape (f).
D'autres paramètres peuvent contribuer à la classification, telle que la « dilution ». L'étape (g) peut ainsi comprendre le calcul d'un coefficient dit de dilution, qui représente le nombre d'occurrences de termes des thématiques liées à la ou les catégories déterminées (en d'autres termes les thématiques des couples des groupes associés aux catégories), présents dans le texte rapporté au nombre total de termes desdites thématiques. On dit alors que le texte est de catégorie X selon la dilution D.
Dans un souci d'optimisation, une estimation de ces paramètres et notamment du coefficient de dilution peut être plus précoce dans le procédé.
Apprentissage et enrichissement
Comme expliqué, les catégories ne sont pas figées et peuvent évoluer. En particulier de nouvelles catégories peuvent être générées et d'autres segmentées.
Si aucune catégorie n'est retenue, une nouvelle catégorie pourra être générée portant un sens nouveau : un nouveau groupe est créé si aucun groupe de couples sous-ensemble/thématique de référence ne contient au moins un couple sous-ensemble/thématique sélectionné pour le texte. Les couples sous-ensemble/thématique deviennent ceux de référence de ce groupe.
Lorsqu'une catégorie devient trop peuplée, une segmentation paramétrable la scinde en deux ou plusieurs catégories. Par ailleurs, les anneaux de propositions non traités par la classification et répondant à certains critères (de score) peuvent être placés dans une pile d'attente. Ainsi, chaque couple sous-ensemble/thématique de référence peut être associé à un score stocké sur les moyens de stockage de données 12, le score d'un couple sous-ensemble/thématique de référence diminuant avec le temps (par exemple suivant un amortissement hyperbolique) mais augmentant à chaque fois que ce couple sous-ensemble/thématique est sélectionné pour un texte.
En d'autres termes, l'enrichissement repose sur deux mécanismes simultanés :
- Le « score » d'un couple anneau/thématique augmente à chaque fois qu'un même anneau est issu de l'analyse
- Le score d'un couple anneau/thématique s'érode avec le temps selon un amortissement hyperbolique.
Et le procédé peut alors comprendre une étape (h) de suppression d'un couple sous-ensemble/thématique de référence d'un groupe si le score dudit couple passe en dessous d'un premier seuil, ou de modification sur les moyens de stockage de données 12 de ladite pluralité de listes associées aux thématiques si le score dudit couple passe au-dessus d'un deuxième seuil.
En particulier, si le score dépasse le deuxième seuil, plusieurs cas peuvent se présenter selon la « connexité » entre l'anneau et la thématique, comme évoqué précédemment.
La connexité entre un anneau et une thématique peut en effet être représentée par un coefficient représentant pour chaque thématique la fréquence d'apparition de cette thématique parmi les thématiques telles que le couple anneau/thématique associé a déjà été sélectionné. En d'autres termes la connexité entre un anneau et une thématique est par exemple donnée comme le score de ce couple anneau/thématique sur la somme des scores associés à des couples de cet anneau avec une thématique de référence.
Les différents cas qui peuvent se présenter sont :
- les anneaux non connexes aux thématiques donnent naissance à de nouvelles thématiques (création d'une nouvelle thématique pour laquelle la liste de mot associée est définie par l'anneau du couple dont le score a dépassé le deuxième seuil) ;
- les anneaux fortement connexes à une thématique (par exemple connexité supérieure à 90%) sont fusionnés dans la thématique connexe (par exemple, si un anneau est très proche d'une thématique mais comprend un mot de plus, ce mot finit par être ajouté à la liste de mots associée à la thématique).
A l'inverse, un anneau fortement érodé (score passant en-dessous du premier seuil) disparait de la pile. Les deux seuils peuvent être définis manuellement en fonction de la « sensibilité », c'est-à-dire le niveau souhaité d'évolutivité du système. Des seuils proches (premier seuil élevé et/ou deuxième seuil bas) entraînent un fort renouvellement des thématiques et catégories.

Claims

REVENDICATIONS
1. Procédé d'analyse sémantique d'un texte en langage naturel reçu par un équipement (1 ) depuis des moyens de saisie (14), le procédé étant caractérisé en ce qu'il comprend la mise en œuvre par des moyens de traitement de données (1 1 ) de l'équipement (1 ) d'étapes de :
(a) Découpage syntaxique d'au moins une partie du texte en une pluralité de mots ;
(b) Filtrage des mots de ladite partie de texte par rapport à une pluralité de liste de mots de référence stockées sur des moyens de stockage de données (12) de l'équipement (1 ), chacune étant associée à une thématique, de sorte à identifier :
• L'ensemble des mots de ladite partie du texte associés à au moins une thématique,
• L'ensemble des thématiques de ladite partie du texte ;
(c) Construction d'une pluralité de sous-ensembles de l'ensemble des mots de ladite partie du texte associés à au moins une thématique ;
(d) Pour chacun desdits sous-ensembles et pour chaque thématique identifiée, calcul :
• d'un coefficient de couverture de la thématique et/ou d'un coefficient de pertinence de la thématique en fonction d'occurrences dans ladite partie du texte de mots de référence associés à la thématique ;
• d'au moins un coefficient d'orientation de la thématique à partir des mots de ladite partie du texte ne faisant pas partie du sous-ensemble ;
(e) Pour chacun desdits sous-ensembles et pour chaque thématique identifiée, calcul d'un coefficient sémantique représentatif d'un degré de sens porté par le sous-groupe en fonction desdits coefficients de couverture, pertinence et/ou orientation de la thématique. (f) Sélection en fonction des coefficients sémantiques d'au moins un couple sous-ensemble/thématique.
(g) Classification du texte en fonction dudit au moins un couple sous- ensemble/thématique sélectionné.
2. Procédé selon la revendication 1 , dans lequel un coefficient de couverture d'une thématique est calculé à l'étape (d) comme le nombre N de mots de référence associés à la thématique compris dans ledit sous- ensemble.
3. Procédé selon l'une des revendications précédentes, dans lequel un coefficient de pertinence d'une thématique est calculé à l'étape (d) par la formule N * (1 + ln(#)), où N est le nombre de mots de référence associés à la thématique compris dans le sous-ensemble et R le nombre total d'occurrences dans ladite partie du texte de mots de référence associés à la thématique.
4. Procédé selon l'une des revendications précédentes, dans lequel deux coefficients d'orientation de la thématique sont calculés à l'étape (c), dont un coefficient de certitude de la thématique et un coefficient de nuance de la thématique.
5. Procédé selon la revendication 4, dans lequel un coefficient de certitude d'une thématique est calculé à l'étape (d) comme valant :
- 1 si les mots ne faisant pas partie du sous-ensemble sont représentatifs d'une proximité affirmative avec la thématique ;
- -1 si les mots ne faisant pas partie du sous-ensemble sont représentatifs d'une proximité négative avec la thématique ;
- 0 si les mots ne faisant pas partie du sous-ensemble sont représentatifs d'une proximité incertaine avec la thématique.
6. Procédé selon l'une des revendications 4 et 5, dans lequel un coefficient de nuance d'une thématique est un scalaire positif supérieur à 1 lorsque les mots ne faisant pas partie du sous-ensemble sont représentatifs d'une amplification de la thématique, et un scalaire positif inférieur à 1 lorsque les mots ne faisant pas partie du sous-ensemble sont représentatifs d'une atténuation de la thématique.
7. Procédé selon l'une des revendications précédentes, comprenant une étape (aO) préalable de découpage du texte en une pluralité de proposition, chacune étant une partie du texte pour laquelle les étapes (a) à (d) du procédé selon répétées de sorte à obtenir pour chaque proposition un ensemble de coefficients de couverture, de pertinence, et/ou d'orientation associés à la proposition, le procédé comprenant préalablement à l'étape (e) une étape (eO) de calcul pour chacun desdits sous-ensemble et pour chaque thématique identifiée pour au moins une proposition du texte d'un coefficient global de couverture de la thématique et/ou d'un coefficient global de pertinence de la thématique, et d'au moins un coefficient global d'orientation de la thématique en fonction de l'ensemble desdits coefficients associés une proposition.
8. Procédé selon la revendication 7, dans lequel un coefficient global de couverture d'une thématique est calculé à l'étape (eO) comme la somme des coefficients de couverture de la thématique associée à une proposition moins le nombre de mots de référence de la thématique présents dans au moins deux propositions.
9. Procédé selon l'une des revendications 7 et 8, dans lequel un coefficient global de pertinence d'une thématique est calculé à l'étape (eO) comme la somme des coefficients de pertinence de la thématique associée à une proposition.
10. Procédé selon l'une des revendications 7 à 9, dans lequel un coefficient global d'orientation d'une thématique est calculé à l'étape (eO) comme la moyenne des coefficients d'orientation de la thématique associés à une proposition pondérés par les coefficients de couverture de la thématique associés.
11. Procédé selon l'une des revendications 7 à 10, dans lequel l'étape (eO) comprend pour chacun desdits sous-ensembles et pour chaque thématique le calcul d'un coefficient global de divergence de la thématique correspondant à l'écart-type de la distribution des produits des coefficients d'orientation par les coefficients de couverture associés à chaque proposition.
12. Procédé selon la revendication 1 1 , dans lequel un coefficient sémantique d'un sous-ensemble A pour une thématique T est calculé à l'étape (e) par la formule M(A,T) = coefficient de pertinence(A,T) * coefficient d'orientation(A,T) * [1 + coefficient de divergence(A,T)2].
13. Procédé selon l'une des revendications précédentes, dans lequel les couples sous-ensemble/thématique sélectionnés à l'étape (f) sont ceux tels que pour toute partition du sous-ensemble en une pluralité de parties dudit sous-ensemble, le coefficient sémantique du sous-ensemble pour la thématique est supérieur à la somme des coefficients sémantiques des sous-parties du sous-ensemble pour la thématique.
14. Procédé selon l'une des revendications précédentes, dans lequel des groupes de couples sous-ensemble/thématique de référence sont stockés sur les moyens de stockage de données (12), l'étape (g) comprenant la détermination du ou des groupes comprenant au moins un couple sous-ensemble/thématique sélectionné à l'étape (f).
15. Procédé selon la revendication 14, dans lequel l'étape (g) comprend la création d'un nouveau groupe si aucun groupe de couples sous-ensemble/thématique de référence ne contient au moins un couple sous-ensemble/thématique sélectionné pour le texte.
16. Procédé selon l'une des revendications 14 et 15, dans lequel chaque couple sous-ensemble/thématique de référence est associé à un score stocké sur les moyens de stockage de données (12), le score d'un couple sous-ensemble/thématique de référence diminuant avec le temps mais augmentant à chaque fois que ce couple sous-ensemble/thématique est sélectionné pour un texte.
17. Procédé selon la revendications 16, comprenant une étape (h) de suppression d'un couple sous-ensemble/thématique de référence d'un groupe si le score dudit couple passe en dessous d'un premier seuil, ou de modification sur les moyens de stockage de données (12) de ladite pluralité de listes associées aux thématiques si le score dudit couple passe au-dessus d'un deuxième seuil.
18. Procédé selon l'une des revendications 14 à 1 7, dans lequel l'étape (g) comprend pour chaque groupe de couples sous- ensemble/thématique de référence le calcul d'un coefficient de dilution représentant le nombre d'occurrences dans ladite partie du texte de mots de référence associés à des thématiques des couples sous- ensemble/thématique de référence présents dans le texte rapporté au nombre total de mots de référence associés auxdites thématiques.
19. Procédé selon l'une des revendications précédentes, dans lequel tous les sous-ensembles de l'ensemble des mots de ladite partie du texte associés à au moins une thématique sont construits à l'étape (c).
20. Equipement (1 ) comprenant des moyens de traitement de données (1 1 ) configurés pour mettre en œuvre suite à la réception d'un texte en langage naturel un procédé selon l'une des revendication précédentes d'analyse sémantique du texte.
PCT/EP2015/051722 2014-01-28 2015-01-28 Procédé d'analyse sémantique d'un texte Ceased WO2015114014A1 (fr)

Priority Applications (3)

Application Number Priority Date Filing Date Title
US15/114,648 US10289676B2 (en) 2014-01-28 2015-01-28 Method for semantic analysis of a text
CA2937930A CA2937930A1 (fr) 2014-01-28 2015-01-28 Procede d'analyse semantique d'un texte
EP15703746.6A EP3100176A1 (fr) 2014-01-28 2015-01-28 Procédé d'analyse sémantique d'un texte

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
FR1400201 2014-01-28
FR1400201A FR3016981A1 (fr) 2014-01-28 2014-01-28 Procede d'analyse semantique d'un texte

Publications (1)

Publication Number Publication Date
WO2015114014A1 true WO2015114014A1 (fr) 2015-08-06

Family

ID=51417300

Family Applications (1)

Application Number Title Priority Date Filing Date
PCT/EP2015/051722 Ceased WO2015114014A1 (fr) 2014-01-28 2015-01-28 Procédé d'analyse sémantique d'un texte

Country Status (5)

Country Link
US (1) US10289676B2 (fr)
EP (1) EP3100176A1 (fr)
CA (1) CA2937930A1 (fr)
FR (1) FR3016981A1 (fr)
WO (1) WO2015114014A1 (fr)

Families Citing this family (6)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US10565291B2 (en) * 2017-10-23 2020-02-18 International Business Machines Corporation Automatic generation of personalized visually isolated text
US11409749B2 (en) * 2017-11-09 2022-08-09 Microsoft Technology Licensing, Llc Machine reading comprehension system for answering queries related to a document
US11593561B2 (en) * 2018-11-29 2023-02-28 International Business Machines Corporation Contextual span framework
CN110134957B (zh) * 2019-05-14 2023-06-13 云南电网有限责任公司电力科学研究院 一种基于语义分析的科技成果入库方法及系统
US10978053B1 (en) * 2020-03-03 2021-04-13 Sas Institute Inc. System for determining user intent from text
CN117521669B (zh) * 2023-11-10 2024-07-02 北京博大网信股份有限公司 一种数学应用题语义分析自动求解系统

Citations (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
EP1462950A1 (fr) * 2003-03-27 2004-09-29 Sony International (Europe) GmbH Procédé pour l'analyse d'une collection de textes
EP1650680A2 (fr) * 2004-10-13 2006-04-26 Hewlett-Packard Development Company, L.P. Dispositif, procédé, arrangement de processeur et support lisible par ordinateur pour le stockage d un programme de classification de documents
US20110179032A1 (en) * 2002-07-12 2011-07-21 Nuance Communications, Inc. Conceptual world representation natural language understanding system and method

Family Cites Families (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US6192360B1 (en) * 1998-06-23 2001-02-20 Microsoft Corporation Methods and apparatus for classifying text and for building a text classifier
US6510406B1 (en) * 1999-03-23 2003-01-21 Mathsoft, Inc. Inverse inference engine for high performance web search
US6990496B1 (en) * 2000-07-26 2006-01-24 Koninklijke Philips Electronics N.V. System and method for automated classification of text by time slicing

Patent Citations (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20110179032A1 (en) * 2002-07-12 2011-07-21 Nuance Communications, Inc. Conceptual world representation natural language understanding system and method
EP1462950A1 (fr) * 2003-03-27 2004-09-29 Sony International (Europe) GmbH Procédé pour l'analyse d'une collection de textes
EP1650680A2 (fr) * 2004-10-13 2006-04-26 Hewlett-Packard Development Company, L.P. Dispositif, procédé, arrangement de processeur et support lisible par ordinateur pour le stockage d un programme de classification de documents

Non-Patent Citations (3)

* Cited by examiner, † Cited by third party
Title
APOORV AGARWAL ET AL: "Contextual phrase-level polarity analysis using lexical affect scoring and syntactic N-grams", PROCEEDINGS OF THE 12TH CONFERENCE OF THE EUROPEAN CHAPTER OF THE ASSOCIATION FOR COMPUTATIONAL LINGUISTICS ON, EACL '09, 30 March 2009 (2009-03-30), Morristown, NJ, USA, pages 24 - 32, XP055162964, DOI: 10.3115/1609067.1609069 *
GRIGORI SIDOROV ET AL: "Syntactic Dependency-Based N-grams as Classification Features", 27 October 2012, ADVANCES IN COMPUTATIONAL INTELLIGENCE, SPRINGER BERLIN HEIDELBERG, BERLIN, HEIDELBERG, PAGE(S) 1 - 11, ISBN: 978-3-642-37797-6, XP047026724 *
T REVATHI ET AL: "Sentence Level Semantic Classification of Online Product Reviews of Mixed Opinions Using Naive bayes Classifier", INTERNATIONAL JOURNAL OF ENGINEERING TRENDS AND TECHNOLOGY, 1 January 2012 (2012-01-01), pages 3 - 2, XP055162614, Retrieved from the Internet <URL:http://www.ijettjournal.org/volume-3/issue-2/IJETT-V3I2P213.pdf> [retrieved on 20150116] *

Also Published As

Publication number Publication date
CA2937930A1 (fr) 2015-08-06
US20160350277A1 (en) 2016-12-01
EP3100176A1 (fr) 2016-12-07
US10289676B2 (en) 2019-05-14
FR3016981A1 (fr) 2015-07-31

Similar Documents

Publication Publication Date Title
US11734329B2 (en) System and method for text categorization and sentiment analysis
WO2015114014A1 (fr) Procédé d&#39;analyse sémantique d&#39;un texte
FR2694984A1 (fr) Procédé d&#39;identification, de récupération et de classement de documents.
EP1977343A1 (fr) Procede et dispositif pour extraire des informations et les transformer en donnees qualitatives d&#39;un document textuel
FR2975201A1 (fr) Analyse de texte utilisant des proprietes de listes linguistiques et non-linguistiques
Hofmann et al. The reddit politosphere: a large-scale text and network resource of online political discourse
US9633008B1 (en) Cognitive presentation advisor
WO2006120352A1 (fr) Dispositif et procede d&#39;analyse semantique de documents par constitution d&#39;arbres n-aire et semantique
Papegnies et al. Impact of content features for automatic online abuse detection
Beleveslis et al. A Hybrid Method for Sentiment Analysis of Election Related Tweets.
CA3131157A1 (fr) Systeme et procede pour categorisation de texte et analyse de sentiments
US11990131B2 (en) Method for processing a video file comprising audio content and visual content comprising text content
EP2013776A1 (fr) Procede de de-doublonnage rapide d&#39;un ensemble de documents ou d&#39;un ensemble de donnees contenues dans un fichier
US9569538B1 (en) Generating content based on a work of authorship
WO2017088126A1 (fr) Procédé et dispositif pour obtenir un mot hors vocabulaire
EP4300326A1 (fr) Procédé d&#39;appariement d&#39;un ensemble à évaluer et d&#39;une liste de référence, moteur d&#39;appariement et programme d&#39;ordinateur correspondants
WO2013117872A1 (fr) Procede d&#39;identification d&#39;un ensemble de phrases d&#39;un document numerique, procede de generation d&#39;un document numerique, dispositif associe
FR3030809A1 (fr) Procede d&#39;analyse automatique de la qualite litteraire d&#39;un texte
CN112801492B (zh) 基于知识阶层的数据质检的方法、装置及计算机设备
FR2970795A1 (fr) Procede de filtrage de synonymes.
FR3163752A1 (fr) Procédé et module de traitement de chaîne de caractères
FR3156945A1 (fr) Procédé et dispositif de sécurisation d&#39;un modèle de langage de grande taille
Danezis Detecting Hate Speech Online using Machine Learning
CN116991973A (zh) 一种基于微博平台文本特征的社交机器人检测系统及方法
WO2022129760A2 (fr) Procede de collecte de donnees, procede d&#39;exploitation de donnees collectees, dispositif electronique et produits programme d&#39;ordinateur et support correspondants

Legal Events

Date Code Title Description
121 Ep: the epo has been informed by wipo that ep was designated in this application

Ref document number: 15703746

Country of ref document: EP

Kind code of ref document: A1

ENP Entry into the national phase

Ref document number: 2937930

Country of ref document: CA

WWE Wipo information: entry into national phase

Ref document number: 15114648

Country of ref document: US

NENP Non-entry into the national phase

Ref country code: DE

REEP Request for entry into the european phase

Ref document number: 2015703746

Country of ref document: EP

WWE Wipo information: entry into national phase

Ref document number: 2015703746

Country of ref document: EP