ES2208164T3 - Metodo y aparato para procesar documentos electronicos. - Google Patents

Metodo y aparato para procesar documentos electronicos.

Info

Publication number
ES2208164T3
ES2208164T3 ES00103810T ES00103810T ES2208164T3 ES 2208164 T3 ES2208164 T3 ES 2208164T3 ES 00103810 T ES00103810 T ES 00103810T ES 00103810 T ES00103810 T ES 00103810T ES 2208164 T3 ES2208164 T3 ES 2208164T3
Authority
ES
Spain
Prior art keywords
document
elements
search
candidate
page
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Expired - Lifetime
Application number
ES00103810T
Other languages
English (en)
Inventor
Alexander Goerke
Matthias Rabald
Pal Rujan
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
SER Solutions Inc
Original Assignee
SER Solutions Inc
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by SER Solutions Inc filed Critical SER Solutions Inc
Application granted granted Critical
Publication of ES2208164T3 publication Critical patent/ES2208164T3/es
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V30/00Character recognition; Recognising digital ink; Document-oriented image-based pattern recognition
    • G06V30/40Document-oriented image-based pattern recognition

Landscapes

  • Engineering & Computer Science (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Artificial Intelligence (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • Multimedia (AREA)
  • Theoretical Computer Science (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
  • Document Processing Apparatus (AREA)
  • Financial Or Insurance-Related Operations Such As Payment And Settlement (AREA)

Abstract

Método implementado por ordenador para generar una entrada a utilizar por un aparato clasificador basada en un documento electrónico que comprende una pluralidad de elementos, caracterizado porque consiste en: analizar dicho documento electrónico para obtener uno o más de dichos elementos junto con información de su posición correspondiente en dicho documento; producir un documento electrónico de configuración de página para usarlo como dicha entrada en dicho aparato clasificador, comprendiendo dicho documento de configuración de página: una representación de una pluralidad de dichos elementos obtenidos en dicha fase de análisis junto con información que representa su posición absoluta y/o relativa en dicho documento electrónico.

Description

Método y aparato para procesar documentos electrónicos.
Campo y antecedentes de la invención
La presente solicitud se relaciona con la solicitud de patente europea con número de solicitud 99108354.4 presentada el 28 de abril de 1999.
La presente invención se refiere a un método y aparato para procesar documentos electrónicos y, en particular, para extraer ciertos elementos de documentos de texto electrónicos.
El procesamiento de documentos electrónicos (EDP) es más importante cada día para hacer frente al gran volumen de documentos que tienen que manipular entidades tales como grandes corporaciones, oficinas de administración y similares. Hoy en día es común tener los documentos en forma electrónica, lo que puede ser el resultado de un proceso de escaneo y de un posterior proceso de reconocimiento óptico de caracteres (OCR) para transformar los documentos escritos a una forma electrónica.
Si se tiene que manipular un gran volumen de tales documentos, por ejemplo para almacenar datos específicos que se encuentran en ellos de un modo ordenado, por ejemplo una base de datos, es conveniente que se puedan sacar de manera automática algunos datos (elementos del documento), por ejemplo la fecha de nacimiento, el lugar de nacimiento, o similar, de tales documentos electrónicos. Por ejemplo, si una empresa quiere procesar automáticamente un gran volumen de currículum vitae, podría ser conveniente sacar esos datos de manera automática de los documentos electrónicos. Además, para otros fines, por ejemplo para sacar información de contabilidad para sistemas ERP, podría ser conveniente la extracción de datos de los documentos de texto. Existen muchas aplicaciones imaginables, para las que podría ser deseable tener una cierta información del texto o de los elementos del texto, o de ciertos números o información de números extraídos de un documento de texto. El documento de texto puede ser, por ejemplo, cualquier documento que contenga ciertos datos de interés que tienen que sacarse debido a que pertenecen a una cierta categoría de información.
Los sistemas de extracción convencionales que pueden extraer datos específicos de documentos de texto electrónicos operan de manera que tienen que buscar una posición fija en un documento donde se supone que están colocados los datos.
Tal tipo de algoritmos de búsqueda no funciona muy bien, ya que depende en gran medida de documentos con un formato predefinido donde los datos buscados siempre están colocados en el mismo lugar.
La patente estadounidense 5,191,525, describe un sistema para procesar automáticamente documentos de papel basado en una extracción automática y un procesamiento de datos presentes en dichos documentos. Con ese propósito, los documentos se pasan primero a un formato electrónico. El sistema puede manipular diferentes tipos de documentos, y primero hay que identificar el tipo de documento. Para ese propósito, existen áreas de identificación geográfica previstas que contienen una palabra o varias palabras de identificación específicas, basada en las cuales se hace la identificación del tipo de documento. Después de identificado el tipo de documento, y tomando como base los conocimientos que se tienen de la composición de este tipo de documento, se realiza una división de las áreas de datos gráficos que se han extraído de la imagen gráfica. Estas áreas se envían al subsistema de reconocimiento y, dependiendo del buen conocimiento que ya se tiene del tipo de documento, pueden contener un cierto tipo de datos que pueden usarse después para procesar este documento. Este sistema que se ha descrito también depende de un conocimiento a priori de la composición de los documentos individuales, en particular del emplazamiento donde se puede esperar un cierto tipo de datos dentro de un cierto tipo de documento.
Por tanto, un objeto de la presente invención es mejorar los métodos convencionales de extracción de ciertos datos de documentos de texto.
Breve descripción de la invención
La presente invención, según un aspecto de la misma, proporciona un método y un aparato para generar un documento de configuración de página que representa un elemento del documento de texto que se puede usar como una entrada para un aparato clasificador. Debido al tipo particular del documento de configuración de página generado según este aspecto de la presente invención, el aparato clasificador puede ejecutar una clasificación mejorada de un elemento del texto representado por el documento de configuración de página. Por tanto, es posible una extracción mejorada de ciertos elementos de texto del documentos de texto.
Según un aspecto de la presente invención, se genera un documento de configuración de página basado en los elementos de un documento de texto electrónico, conteniendo la configuración de página una representación de elementos de dicho documento junto con representaciones de su posición correspondiente. Al generarse dicho documento de configuración de página que se puede usar como una entrada para un aparato clasificador, por ejemplo una red neural, es posible evaluar los elementos de un documento junto con sus elementos de contexto geométricos (cercanos/circundantes) y hacer así uso no sólo del formato o del contenido de un elemento por sí mismo sino también de otra información para evaluar si el elemento pertenece o no a una categoría determinada. Teniendo en cuenta no sólo un elemento o su formato, sino también su área circundante, es decir, los elementos que se encuentran dentro del área circundante, un aparato clasificador recibe más indicaciones de si un elemento de texto pertenece o no a una categoría determinada. Esas indicaciones adicionales que proporciona el área circundante y los elementos de texto que se encuentran en ella, pueden reconocerse o aprenderse mediante un aparato clasificador, por ejemplo una red neural, y así una red neural preparada puede proporcionar una clasificación mejorada y en consecuencia una extracción mejorada de elementos de los documentos de texto.
Según otro aspecto de la presente invención, se generan configuraciones de página para una pluralidad de elementos que pertenecen a una categoría determinada, y las configuraciones de página generadas se utilizan después para preparar el aparato clasificador con el fin de reconocer elementos de esa categoría. De manera preferible, el aparato clasificador es una red neural que se prepara mediante las configuraciones de página generadas para una pluralidad de elementos, y mediante entradas en el aparato en la fase de preparación ya pertenezcan o no los elementos para los que se han generado las configuraciones de página a una determinada categoría. Una red neural o aparato clasificador preparado de este modo se puede utilizar también para clasificar elementos de un texto desconocido y para extraer elementos de textos desconocidos.
Según otro aspecto de la presente invención, un aparato clasificador que se ha preparado, se utiliza para evaluar si un elemento desconocido pertenece o no a una categoría determinada basado en un documento de configuración de página generado para este elemento, con el fin de extraer de este modo elementos de un documento que pertenecen a una categoría determinada.
Según otro aspecto de la presente invención, se identifican candidatos que, dependiendo de un determinado criterio de búsqueda, podrían pertenecer a la categoría a la que deberían pertenecer los datos extraídos. De manera preferible, un criterio de búsqueda puede ser un formato de un elemento, un criterio de búsqueda de palabra, un criterio de búsqueda de palabra tolerante de fallo, o una combinación de tales criterios. Para cada uno de estos candidatos, se puede generar después un documento de configuración de página basado en el propio candidato, su posición en el documento electrónico, y en base a otros elementos del documento electrónico y su posición en dicho documento. De manera preferible, cuando se genera el documento de configuración de página, se tienen en cuenta los elementos que están dentro de una o más áreas predefinidas, preferiblemente las que están cerca de o rodeando al candidato.
Tomando como base tal documento de configuración de página, se juzga después si el candidato pertenece o no en realidad a la categoría deseada.
Según una realización preferida de la presente invención, la decisión de si dicho candidato pertenece o no a la categoría deseada se hace usando un aparato clasificador que es preferiblemente una red neural. La red neural puede haberse preparado usando documentos de configuración de página de candidatos y comunicando además a la red neural como una entrada si los candidatos pertenecen o no a la categoría deseada.
Según otra realización preferida, la decisión de si un candidato pertenece o no a la categoría deseada se hace usando un método o un aparato como en el que se describe en la solicitud de patente europea 99108354.4, solicitada el 28 de abril de 1999, cuya prioridad se reivindica para la presente solicitud, y que se incorpora aquí como referencia.
Breve descripción de los dibujos
La figura 1, muestra un sistema informático que se puede utilizar para aplicar una realización según la presente invención.
La figura 2, ilustra un ejemplo de un documento de texto del cual se van a extraer elementos.
La figura 3, muestra un ejemplo de un documento de trabajo creado a partir de un documento de texto.
La figura 4, muestra un ejemplo de una interfaz de usuario para la definición de un área de configuración de página.
La figura 5a, muestra un ejemplo de un área de configuración de página.
La figura 5b, muestra un ejemplo de un documento de configuración de página.
La figura 6, muestra un ejemplo de un código para codificar un recuadro de candidato.
La figura 7, muestra un ejemplo para codificar las posiciones de los elementos de un documento de configuración de página.
La figura 8, muestra un ejemplo de una fase de aprendizaje de un aparato clasificador.
La figura 9, muestra un ejemplo de una fase de extracción de un aparato clasificador.
Descripción detallada de las realizaciones preferidas
La presente invención se puede aplicar mediante un sistema informático como el que se muestra en la figura 1.
La figura 1 muestra esquemáticamente la configuración de un sistema informático para usar en la realización preferida de la presente invención. El ordenador 100 contiene una CPU 110, una memoria 120 y una unidad I/O 130. El ordenador 100 puede ejecutar programas siguiendo las instrucciones de ordenador de la CPU 110 que la CPU extrae de la memoria 120 y que se pueden haber almacenado en un dispositivo de almacenamiento 150 tal como un CD-ROM o un disquete. La unidad I/O está conectada a un teclado 160 y a un ratón 170 para permitir al usuario que introduzca datos en el ordenador, y está conectada también a una impresora 180 para producir documentos tales como documentos impresos. El ordenador 100 está conectado también a una unidad de visualización 140 tal como un monitor. Se debe entender que la configuración del ordenador mostrada en la figura 1 es únicamente un ejemplo y que en la presente invención pueden usarse otras configuraciones de ordenador, tales como por ejemplo ordenadores de procesamiento paralelos, ordenadores de red neural con hardware especializado o cualquier otro sistema informático que pueda realizar el método explicado antes.
A partir de ahora, la presente invención se describe para la extracción de una fecha de nacimiento de un curriculum vitae como el que se muestra en la figura 2. Cualquier persona versada en la materia puede entender fácilmente que la descripción de la presente invención en relación con la extracción de una fecha de nacimiento de un curriculum vitae se hace sólo con propósitos explicativos, y que el mismo método y aparato que se describen a partir de ahora se pueden aplicar a cualquier otro documento de texto del que se van a extraer ciertas informaciones tales como, por ejemplo, un número de cuenta bancaria de un estado contable, precios de facturas, valores de existencias en fábrica a partir de los documentos correspondientes, etc.
El curriculum vitae está almacenado en un ordenador o en un soporte de datos en forma electrónica y puede haber sido el resultado de una edición usando un procesador de textos, o el documento electrónico puede ser el resultado de un proceso de exploración y de un proceso de reconocimiento de caracteres ópticos posterior. En vez del curriculum vitae, se puede utilizar cualquier documento del que se pueda extraer un elemento que tenga un significado específico o que esté dentro de una cierta categoría.
Al principio, el documento electrónico se analiza para obtener los elementos individuales que lo componen. Aquí, "elemento" quiere decir cualquier secuencia de caracteres que se separa de otros elementos mediante un delimitador, tal como por ejemplo un espacio, un tabulador, un subrayado o cualquier otra cosa, que pueda interpretarse como delimitador entre dos elementos. El modo más sencillo de separar un texto en elementos individuales consiste en identificar las partes textuales como elementos que se han separado entre si mediante un espacio en blanco (un espacio). Sin embargo, dependiendo de la finalidad del análisis, se pueden tener en cuenta también otros criterios tales como el subrayado ya mencionado, un guión, una vuelta del carro u otras partes del documento electrónico que puedan considerarse como delimitadores de elementos. Otro criterio que podría tenerse en cuenta cuando se van a identificar elementos individuales podría ser la distancia geométrica entre caracteres individuales. Por ejemplo, se podría definir un valor umbral más allá del cual una distancia entre dos caracteres se interpreta como que los dos caracteres son elementos diferentes. En el presente ejemplo, aceptamos que un elemento es cualquier carácter individual o secuencia de caracteres separados de otros "elementos" mediante un espacio.
En el presente ejemplo de un documento de texto como el que se muestra en la figura 2, los dos primeros elementos serían "curriculum" y "vitae", otros elementos serían: "teléfono", "fax", etc, como queda claro para los versados en la materia. Los elementos se identifican, por ejemplo, mediante un analizador que busca espacios.
Además de obtener los elementos por si mismos, se obtiene su posición correspondiente en el documento, por ejemplo calculando las coordenadas "x" e "y" de la situación de cada elemento en el documento. La posición se utiliza después para producir el documento de configuración de página.
Después de haber identificado los elementos individuales del documento de texto electrónico, estos elementos se almacenan en el denominado "documento de trabajo". En el documento de trabajo, cada elemento identificado, se almacena junto con datos que tienen que ver con su posición en el documento electrónico. Por ejemplo, el elemento "curriculum" puede almacenarse junto con sus coordenadas "x" e "y" que identifican su posición en el documento electrónico. El documento de trabajo es una herramienta útil para almacenar todos los elementos que se han identificado junto con su posición correspondiente, con lo cual se puede producir el documento de configuración de página que se va a explicar después en detalle en el documento de trabajo. Un ejemplo de un documento de trabajo generado a partir de un documento de texto se muestra en la figura 3. Las etiquetas: etiqueta 1, etiqueta 2, etc., contienen la información de la posición de los elementos correspondientes. Esta información se puede representar de cualquier manera, por ejemplo almacenando directamente las coordenadas "x" e "y" de los elementos en las etiquetas. Los elementos de la figura 3 pueden ser, por ejemplo, las palabras individuales identificadas en un documento de texto, o cualquier otra secuencia de caracteres identificados como elementos con el método explicado antes, y las etiquetas contienen información de la posición de dichos elementos, por ejemplo dónde están situados según sus coordenadas "x" e "y". Las etiquetas pueden comprender también indicaciones del estilo de los elementos, su familia de caracteres, si están subrayados o no, o cualquier otra información similar. Por ejemplo, para un elemento en negrita, la etiqueta correspondiente puede comprender la secuencia de caracteres "bf" que representa ese elemento en caracteres en negrita, otra secuencia de caracteres puede representar que el elemento está subrayado, o similar.
La posición de un elemento puede representar, por ejemplo, el centro de gravedad de un elemento calculado según su valor en píxeles o cualquier otra información geométrica del emplazamiento del elemento. Por ejemplo, se puede construir un recuadro que rodee el elemento, y la media entre las coordenadas "x" máxima y mínima del recuadro considerarse como coordenada "x", y la media entre las coordenada "y" máxima y mínima del recuadro considerarse como coordenada "y" del elemento cuando se representa su posición en el texto mediante una etiqueta correspondiente del documento de trabajo.
El documento de trabajo contiene una lista de los elementos identificados junto con las etiquetas que indican su posición correspondiente y posiblemente también más información como se ha mencionado antes, por ejemplo más información sobre la familia de los elementos, su estilo, si están subrayados o no, etc.
De este modo se crea el documento de trabajo que contiene una lista de los elementos individuales del documento de texto electrónico junto con su posición correspondiente y posiblemente también otras informaciones. Además, se pueden incorporar elementos no textuales en el documento de trabajo, por ejemplo líneas o cuadrículas horizontales o verticales contenidas en el documento electrónico, que se almacenan después en el documento de trabajo de modo que se representa su posición y su forma (horizontal, vertical, cuadrícula o similar) según un código. Por ejemplo, en un documento de trabajo se puede representar una línea horizontal mediante una secuencia de caracteres AAAA; una línea vertical mediante una secuencia de caracteres BBBB, cada una de las cuales seguida de una etiqueta que indica la posición de la línea.
El documento creado de este modo puede utilizarse después para identificar elementos candidatos que posiblemente podrían ser el elemento a extraer. Con este propósito, se analiza el documento de trabajo (o posiblemente también el "documento original" en que se basa el documento de trabajo) para identificar los elementos que cumplen un cierto criterio de búsqueda, por ejemplo un criterio formal. En esta fase de extracción de un candidato, se analizan todos los elementos para encontrar posibles candidatos para los elementos deseados a extraer.
De manera preferible, no sólo se buscan elementos individuales sino también combinaciones de elementos, por lo cual el método puede incluir espacios entre los elementos individuales. Por ejemplo, cuando se busca un número de cuenta bancaria, que se supone que tiene ocho dígitos, se puede realizar una búsqueda de un número que tenga ocho dígitos que pueden representarse como "99999999" o como "999 999 99" o como "9 9 9 9 9 9 9 9" o cualquier otra combinación. Por tanto, la búsqueda de tal número de cuenta bancaria se puede realizar, por ejemplo, buscando un número que tenga ocho dígitos. Dependiendo del contenido informativo que tenga el elemento a extraer, se puede usar otro formato como criterio de búsqueda. Los criterios de búsqueda posibles buscan expresiones comunes (por ejemplo una búsqueda de formato que busca un formato determinado, por ejemplo una serie de caracteres, una secuencia de números, que posiblemente también necesita un determinado número total de dígitos), o similares. Otro criterio de búsqueda podría ser la búsqueda de un elemento simple definido, llevando a cabo una comparación en serie de caracteres. Por ejemplo se puede realizar una búsqueda de la palabra "nacimiento", y cada elemento que cumpla ese criterio de búsqueda se mostraría después como candidato.
Otro criterio de búsqueda posible podría ser utilizar la denominada búsqueda de indicador, que significa que se busca un elemento situado en una posición determinada (izquierda/derecha/arriba/abajo) con respecto a un candidato encontrado mediante otro criterio de búsqueda. Por ejemplo, si un criterio de búsqueda consiste en buscar la palabra "nacimiento", se podría llevar a cabo una búsqueda de indicador para el elemento situado a la derecha del elemento "nacimiento", y en este caso, el candidato resultante sería el elemento situado a la derecha del elemento "nacimiento". En el ejemplo de la figura 2, con tal búsqueda de indicador, el elemento "5 de mayo de 1960" aparecería como candidato.
Otro criterio de búsqueda podría ser llevar a cabo una búsqueda de todos los elementos que están presentes en una base de datos.
La búsqueda de candidatos preferiblemente tolera fallos en el sentido de que se pueden ignorar prefijos y sufijos, para evitar errores típicos que se cometen al reconocer ópticamente los caracteres, o para poder ignorar elementos tales como "." y ":". Por ejemplo, en el caso de la figura 2, se puede realizar una búsqueda de la palabra "nacimiento" usando tal búsqueda tolerante de fallos, por ejemplo usando un comodín. Después se puede realizar una búsqueda del elemento "nacimiento", con lo cual el elemento "nacimiento" aparecería como candidato. Después se podría obtener de la búsqueda de indicador, el dato real situado a la derecha del elemento "nacimiento" como
\hbox{candidato.}
Dependiendo del modo en el que se realice la búsqueda de candidatos, se identificarán más o menos candidatos para los elementos a extraer.
Otros métodos de búsqueda podrían incluir, por ejemplo, una búsqueda trigrama, que quiere decir que se buscan combinaciones de tres caracteres. Este es también un método para realizar una búsqueda tolerante de fallos, ya que si, por ejemplo, se produce un error de ortografía en un candidato, la búsqueda trigrama podría obtener en cualquier caso tal candidato ya que se reconocerían varias secuencias de caracteres que están contenidas en el candidato como trigramas correctos. Otro método de búsqueda tolerante de fallos consistiría en usar la distancia Levenshtein, que es una representación del número de pulsaciones de tecla necesarios en un teclado para cambiar una secuencia de caracteres por otra. Con base en la distancia Levenshtein, también se podría realizar una búsqueda tolerante de fallos.
La búsqueda de candidatos se realiza, de manera preferible, buscando en el documento de trabajo elementos que coincidan con el criterio de búsqueda usado. Por ello se puede utilizar el análisis de elementos del documento que ya se ha realizado. En principio, sin embargo, se puede llevar a cabo también una búsqueda de candidatos directamente en el documento de texto.
La búsqueda tiene como objetivo obtener elementos candidatos que puedan contener la información que se busca. Queda claro que, dependiendo de la información que se busque, se tiene que adaptar el criterio de búsqueda. Si se busca un número de cuenta bancaria, se usa preferiblemente un criterio de formato que haga uso del formato de número posiblemente conocido del número de cuenta. Por el contrario, si se busca el lugar de nacimiento, es más conveniente buscar series de caracteres que números. Cualquiera versado en la materia puede adaptar el criterio de búsqueda (búsqueda de formato, búsqueda de palabra, búsqueda de base de datos, búsqueda de indicador, etc., o una combinación de las mismas) a la información particular que se busca dependiendo de las circunstancias particulares.
Si los candidatos encontrados se van a utilizar en un proceso de preparación para un aparato clasificador, como se describe con más detalle después, es preferible que se indiquen o muestren al usuario de algún modo y que el usuario pueda confirmar si los candidatos encontrados coinciden o no con la información buscada. De ese modo, el aparato clasificador puede prepararse como se explica después. Los candidatos se pueden mostrar, por ejemplo, destacándolos en el documento de texto buscado para que el usuario los confirme o descarte apretando, por ejemplo, el ratón.
La búsqueda de formato o la búsqueda de elementos tolerante de fallos proporciona candidatos para elementos que a extraer. El resultado de la búsqueda de candidatos es ya bastante buena en términos de corrección ya que se basa en las propiedades inherentes de los elementos que se buscan, por ejemplo su formato o su contenido informativo real. Los candidatos, sin embargo, se pueden evaluar después con respecto a si pertenecen a una categoría concreta o no, teniendo en cuenta también otros elementos que no sean los candidatos, como se explica después.
A continuación se crea, para cada candidato, un documento denominado documento de configuración de página que contiene no sólo una representación del candidato y su posición en el documento electrónico, sino también otros elementos que rodean dicho elemento candidato y su posición correspondiente. Por tanto, el documento de configuración de página es una representación electrónica del candidato y su posición en el mismo documento electrónico, así como de otros elementos que están en el documento electrónico y su posición correspondiente. De manera preferida, un documento de configuración de página para un candidato determinado se genera para un área determinada que rodea dicho candidato. Esta área (o una pluralidad de áreas correspondientes) se puede predefinir o definir por el usuario.
Un ejemplo de definición de tal área circundante hecha a través de la interfaz del usuario, se muestra en la figura 4. La figura 4 muestra cómo un usuario puede definir cuatro recuadros en total que rodean dicho candidato. Un primer recuadro rodea el candidato en todas direcciones, un segundo recuadro representa los confines a la izquierda del candidato, un tercer recuadro representa los confines a la derecha del candidato, y un cuarto recuadro representa los confines encima del candidato. De manera opcional, se puede utilizar también otro recuadro que represente los confines que están debajo del candidato. El usuario puede medir el tamaño de los recuadros, por ejemplo introduciendo valores que representen su tamaño en puntos por pulgada o cualquier otra unidad como por ejemplo píxeles, mm, o similares. En el ejemplo de la figura 4, el usuario puede medir el tamaño de los recuadros, sin embargo, estos recuadros también se puede predefinir. El usuario puede definir un área para producir el documento de configuración de página dependiendo de la categoría específica del elemento que desee extraer.
Para producir el documento de configuración de página, se tienen en cuenta todos los elementos que, teniendo en cuenta su posición en el documento electrónico, se encuentran dentro de los recuadros que definen el área del documento de configuración de página para producir el documento de configuración de página. Para este propósito, se puede hacer referencia al documento de trabajo en el que están almacenados todos los elementos junto con sus posiciones correspondientes.
A continuación, supongamos que el proceso para obtener elementos candidatos vuelve al elemento 5 de mayo de 1960 del documento de la figura 2 como candidato. Este puede ser, por ejemplo, el resultado de una búsqueda de formato que busca una combinación de tres elementos individuales en serie, y donde los tres elementos deben contener dos números enteros (que representan el día y el año) y otro número o palabra que represente el mes. El resultado de la búsqueda podría ser la serie de los tres elementos. Se puede imaginar también otro criterio de búsqueda que nos lleve al 6 de mayo de 1960 como candidato, dando como resultado tal búsqueda de indicador que busca tres elementos cerca del elemento "nacimiento", el 6 de mayo de 1960 transferido como candidato. Cualquier otra búsqueda de expresiones comunes podría dar también como resultado un candidato como el 6 de mayo de 1960, por ejemplo la búsqueda de una expresión común que contenga tres elementos, siempre que dos de los tres elementos sean números y el tercer elemento sea una palabra o un número, y donde uno de los números esté dentro de un margen que oscile entre 1 y 31. Queda claro para cualquier persona versada en la materia que son posibles muchas definiciones de criterios de búsqueda que nos lleven a candidatos de una información que sea una "fecha".
Después de obtenidos uno o más candidatos mediante un proceso de búsqueda como el que se ha explicado antes, se crea para cada uno de los candidatos un documento de configuración de página que es una representación del candidato y de su área circundante. Para crear el documento de configuración de página, se identifican primero los elementos que están dentro del área que se va a usar para la generación del documento de configuración de página, y después, en base a estos elementos, se crea el documento de configuración de página. Este contiene una representación del candidato y los elementos que están dentro de esta área junto con la posición correspondiente de estos elementos.
La figura 5a muestra un ejemplo de un área designada en el caso del documento de texto de la figura 2. El candidato aquí es "5 de mayo de 1960", y la línea de puntos de la figura 5a define el área designada que rodea al candidato. Todos los elementos del documento de la figura 2, respectivamente los de la figura 5a que están dentro de esta área, se usan para producir el documento de configuración de página. El área mostrada en la figura 5a puede ser el resultado de una definición del usuario que utiliza una interfaz como la de la figura 4 o puede también predefinirse.
En la figura 5b, se muestra un ejemplo de documento de configuración de página generado para el candidato "5 de mayo de 1960" y el área correspondiente designada como se muestra en el ejemplo de la figura 5a. El primer renglón del documento de configuración de página corresponde al mismo elemento "5 de mayo de 1960". Este está representado en el documento de configuración de página mediante la secuencia de caracteres "DDMMYY", ya que según la aplicación particular de la presente realización, se reconoce que su formato corresponde a una "fecha". Sin embargo ello no es necesario, sino sólo una opción preferible cuando se genera el documento de configuración de página, que se sustituya un elemento reconocible cuyo formato se pueda reconocer en el documento de configuración de página por una representación correspondiente de dicho formato, como aquí mediante DDMMYY como una representación del formato "fecha". La secuencia de caracteres que está a la derecha de la secuencia "DDMMYY" representa la posición de este elemento en el documento electrónico, como se explica después con más detalle.
El primer renglón del documento de configuración de página que se muestra en la figura 5b corresponde por tanto al elemento candidato "5 de mayo de 1960". La posición del candidato en el documento electrónico que se muestra en la figura 2 y también su tamaño se representa mediante la secuencia de caracteres "MXMYWLHM", como queda más claro en la siguiente explicación.
Para explicar con más detalle cómo se representa la posición del elemento candidato que está en el documento electrónico en el documento de configuración de página mediante la secuencia de caracteres "MXMYWLHM", hay que hacer referencia a la figura 6. La figura 6 muestra un recuadro denominado recuadro del candidato que quiere decir el rectángulo limítrofe del elemento candidato. Dependiendo del tamaño del elemento candidato (por ejemplo, dependiendo de la familia de caracteres) también varía el tamaño del recuadro del candidato y puede representarse en el documento de configuración de página utilizando el código para el tamaño de recuadro que se ilustra esquemáticamente en la parte derecha de la figura 6. Basándose en este código, el tamaño del recuadro se codifica como "WLHM" que quiere decir que el recuadro del candidato tiene una "gran anchura" (WL) y una "altura media" (HM), como podemos ver en la figura 6. Esta secuencia de programación nos lleva a los cuatro últimos caracteres WLHM del primer renglón del documento de configuración de página de la figura 5b. Se puede entender fácilmente que los valores reales se representan mediante secuencias de programación, en otras palabras, los valores se codifican como "pequeños" y "grandes" dependiendo de la aplicación particular y son una mera cuestión de elección por parte de la persona versada en la
\hbox{materia.}
Por tanto, como se puede ver en el primer renglón del documento de configuración de página que se muestra en la figura 5b, no sólo se codifica la posición del recuadro del candidato (que representa la posición del mismo candidato) en el documento, como se explica después, sino también el tamaño del recuadro del candidato (que representa el tamaño del candidato). La representación del tamaño del recuadro del candidato mediante una secuencia de programación correspondiente se ilustra esquemáticamente en la parte inferior del lado derecho de la figura 6. Un recuadro de candidato que tenga un candidato pequeño en una dirección "x" se codifica como "WS" (para una "anchura pequeña"), un recuadro de candidato que tenga un tamaño medio se codifica como "WM" (para una "anchura media"), y un recuadro de candidato que tenga un tamaño grande en la dirección "x" se codifica como "WL" (para una "anchura grande"), y un recuadro de candidato que tenga un tamaño extra grande en la dirección "x" se codifica como "WX" (para una "anchura extra grande"). De manera parecida, se van a asignar valores a las secuencias de programación como mera cuestión de elección por parte de la persona versada en la materia.
De manera parecida a la anchura, también se codifica la altura del recuadro del candidato mediante una de las secuencias "HS", "HN", "HL", o mediante "HS". Para el presente caso de la figura 5b con el candidato 5 de mayo de 1960, el recuadro del candidato se codifica como "WLHM", que quiere decir que tiene una gran extensión en la dirección "x" y un tamaño medio en la dirección "y".
La posición del recuadro del candidato en las direcciones "x" e "y" se codifica como se ilustra esquemáticamente en la parte izquierda de la figura 6. Para este propósito, a ciertas áreas del documento que se muestra en la figura 2 se les asignan secuencias de programación como las que se muestran en la parte izquierda de la figura 6. Dependiendo del área en la que se coloque el recuadro del candidato, las posiciones "x" e "y" del recuadro del candidato se codifican como "LL", "MX", "RR" (para la posición "x"), y como "TT", "MY" o "BB" (para la posición "y").
En el presente caso de la figura 5a para el candidato 5 de mayo de 1960, el recuadro del candidato con respecto a su emplazamiento en la dirección "x" es medio, lo que quiere decir que no está ni muy lejos de la parte derecha del documento ni muy lejos de la parte izquierda del documento, sino más bien en el centro del documento con respecto a su posición "x". Tal emplazamiento se codifica mediante la secuencia de caracteres "MX", como puede verse en la parte izquierda de la figura 6. La posición "y" del recuadro del candidato se codifica mediante la secuencia "MY", ya que con respecto a su posición "y", está relativamente en el centro de dicho documento. De aquí se puede deducir el código de posición "MXMY" que se muestra en el primer renglón del documento de configuración de página, a partir del recuadro del candidato. La combinación de la representación del formato del candidato, la posición del recuadro del candidato y el tamaño del recuadro del candidato da como resultado la secuencia de caracteres que se muestra en el primer renglón de la figura 5b.
Se debe entender que la codificación que se muestra en la figura 6 para el recuadro del candidato es sólo un ejemplo, y que se pueden usar también otros códigos, otras distribuciones entre posición y código y otras divisiones del documento en áreas correspondientes. La granularidad del tamaño y la posición del recuadro del candidato puede ser más fina o más gruesa que en la figura 6 dependiendo de la aplicación particular, como puede reconocer fácilmente cualquier persona cualificada.
De manera similar, las secuencias de programación que se han utilizado aquí son sólo arbitrarias. Aquí, "LL" significa "absolutamente en la izquierda", "MX" significa "justo en el medio en la dirección "x", y "RR" significa "absolutamente en la derecha del documento (en la posición "x"). De manera parecida, "TT" significa "absolutamente en la parte superior", "MY" significa "justo en el medio", y "BB" significa "absolutamente en la parte inferior del documento con respecto a la dirección y". Sin embargo, se pueden usar también otras secuencias de programación siempre que puedan ser reconocidas por una persona cualificada. Además, en vez de DDMMYY se pueden utilizar otras secuencias de caracteres para representar el formato reconocido de una "fecha".
Después de haber codificado el recuadro del candidato como se ha explicado antes, los otros elementos que están dentro del área del documento de configuración de página que se ha explicado con respecto a la figura 5a también se codifican e incorporan en el documento de configuración de página.
El documento de configuración de página que se muestra en la figura 5b se ha creado tomando como base un área que se muestra en la figura 5a mediante la línea de puntos. Como ya se ha explicado antes, el área circundante se puede fijar de manera diferente en un área más pequeña, dependiendo de las preferencias del usuario y de la carga de trabajo de cálculo que puede procesar el ordenador en uso, y, naturalmente, se puede fijar en un área más grande. Por tanto, se entiende que los diseños que se utilizan aquí son solamente ejemplos, y que se pueden utilizar también otras definiciones de áreas. Naturalmente, cuanto mayor sea el área usada, más información se puede incluir en el documento de configuración de página creado a partir de esta área y por tanto, es posible que con un área aumentada aumente a su vez la precisión de la evaluación del documento de configuración de página. Sin embargo, esto depende de la aplicación particular y del propósito particular, y con áreas designadas pequeñas, también se pueden conseguir buenos resultados.
El segundo renglón del documento de configuración de página de la figura 5b es una representación del número de fax que se muestra en la figura 5a y está dentro del área designada. Como según la aplicación particular de la presente realización se reconoce que los dos elementos 07029 y 8125, que están dentro del área designada, son números enteros, éstos se representan en el documento de configuración de página mediante una secuencia de programación asignada a la representación del números enteros, es decir IIQQ.
Los renglones segundo y tercero del documento de configuración de página que se muestra en la figura 5b, representan el código de área 07029 y el número 8125, respectivamente. La secuencia de programación IIQQ que representa un número entero viene seguida después por una secuencia de programación del número entero en el documento de texto de la figura 2 con respecto al elemento candidato.
Para codificar la posición correspondiente, se puede utilizar cualquier código. El código particular que se utiliza aquí se ilustra esquemáticamente en la figura 7. Para codificar gamas de distancias discretas correspondientes a las posiciones relativas en las direcciones "x" e "y", se asignan secuencias de programación correspondientes, por ejemplo, "NR" para cerca, "FF" para lejos, "HEE" para una posición igual en dirección horizontal, "VFF" para una posición igual en dirección vertical, y así sucesivamente. El código particular se ilustra en la figura 7 aunque se entiende que es simplemente un ejemplo y se puede modificar muy fácilmente. Por ejemplo, las secuencias de programación pueden ser diferentes, la separación en rangos discretos puede ser diferente, el número de rangos, y así sucesivamente.
En la figura 7, en relación con la figura 5b, se debe entender que el segundo renglón del documento de configuración de página de la figura 5b se basa en el hecho de que el código de área 07029 está cerca hacia la izquierda (LNR) y cerca por encima (ANR) del recuadro del candidato, lo que nos deriva a una secuencia de programación de posición LNRANR como la que se muestra en el segundo renglón de la figura 5b unida al código de números enteros IIQQ.
Como el número 8125 es horizontalmente igual aunque está cerca del candidato, por encima del mismo, esto nos conduce al tercer renglón de la figura 5b que se lee IIQQHEEANR.
Los tres elementos restantes "fecha", "de" y "nacimiento" que están dentro del área designada, se representan en los tres últimos renglones del documento de configuración de página de la figura 5b junto con sus secuencias de programación de posición correspondientes que se entienden fácilmente en conexión con la figura 7. Todos los elementos son verticalmente iguales al candidato (VEE) aunque a distancias horizontalmente diferentes del candidato.
Queda claro que en vez del código de posición relativa, también se pueden usar posiciones absolutas de los elementos que están dentro del área designada para producir el documento de configuración de página.
Además, cuando se genera el documento de configuración de página, también es posible codificar otros elementos similares de los cuales se puede reconocer el formato, no sólo, por ejemplo, cuando el elemento tiene el formato de una "fecha", en el documento de configuración de página mediante una secuencia de programación correspondiente. Aunque aquí sólo se muestra la fecha en el primer renglón y los números enteros en los renglones segundo y tercero del documento de configuración de página, se pueden sustituir también por otros elementos que se puedan reconocer, por ejemplo códigos postales (que se pueden reconocer consultando una base de datos) y que se pueden representar mediante una secuencia de caracteres determinada tal como ZZZ, o similar. El reconocimiento correspondiente se puede basar en un reconocimiento de formato o en la consulta de una base de datos (donde por ejemplo están almacenados los códigos
\hbox{postales).}
Como se ha explicado antes, se genera un documento de configuración de página que contiene información del mismo candidato, su posición en el documento y además información de otros elementos del documento y su posición en el documento. En el presente ejemplo, la información referente a la posición se representa sustituyendo valores de las coordenadas por secuencias de caracteres que representan una posición según un código determinado que se usa para definir los emplazamientos o áreas en los que se divide el documento electrónico para fines de codificación y a los que se les han asignado códigos de caracteres correspondientes. De manera similar, se pueden utilizar códigos numéricos para codificar también las posiciones de los elementos de dicho documento electrónico. Se puede usar cualquier código que represente la posición y/o el formato de los elementos para producir el documento de configuración de página.
El documento de configuración de página también contiene información adicional de elementos no textuales del documento a analizar, por ejemplo renglones o cuadrículas que están en el documento. Esta información se puede obtener fácilmente mediante un análisis geométrico del documento, y después los renglones o cuadrículas presentes en un documento se pueden codificar en el documento de configuración de página mediante secuencias de programación correspondientes, preferiblemente también representando su posición correspondiente, posiblemente también su estilo y más información.
De manera preferible, el código usado para producir el documento de configuración de página contiene una codificación de posición basada en la asignación de áreas discretas de emplazamiento correspondientes a códigos de posición como los que se han explicado antes. Más preferiblemente aún, en el documento de configuración de página se representa también información del estilo o el formato que se puede reconocer como el formato o estilo de elementos mediante secuencias de programación correspondientes. Sin embargo, para producir un documento de configuración de página, es posible utilizar solamente algunos de estos elementos de un código.
La posición que se indica en el documento de configuración de página puede ser una representación de la posición geométrica basada en los valores de las coordenadas, por ejemplo los valores de las coordenadas "x" e "y" que se han explicado antes. Sin embargo, también es posible que la información de la posición de un elemento que está en el documento de configuración de página represente la posición relativa entre el candidato y este elemento, por ejemplo el número de elementos que aparecen entre este elemento y el candidato. Por tanto, también es posible codificar la posición relativa entre el candidato y otros elementos que están en el área designada mediante la distancia entre los mismos a través del número de palabras que aparecen entre ellos. Tal código puede ser útil, por ejemplo si el documento de texto a procesar en realidad no tiene mucho diseño propio, por ejemplo un correo electrónico. Sin embargo, como alternativa, para un correo electrónico se podría utilizar y calcular un diseño virtual para el procesamiento posterior en vez de la posición relativa de los elementos como se ha explicado antes.
Cuanta más información esté presente en el documento de configuración de página del candidato y sus elementos circundantes, más precisos serán el documento de configuración de página y el resultado del procesamiento posterior. Sin embargo, cuanto más sofisticado sea el documento de configuración de página, más potencia de proceso se necesitará para crear el documento de configuración de página y para procesarlo después para tomar la decisión. Por tanto, dependiendo de la precisión deseada del proceso de decisión, el usuario o programador puede elegir el área para producir el documento de configuración de página así como la información a utilizar cuando se genere el documento de configuración de página.
Hasta aquí se ha explicado la obtención de candidatos y la generación posterior de un documento de configuración de página para un candidato. Si ahora se desea, por ejemplo, extraer una información, por ejemplo la fecha de nacimiento del documento de la figura 2, se lleva a cabo una búsqueda de candidatos en el documento para obtener candidatos para una fecha. En el caso de la figura 2, una búsqueda de expresión normal o de formato como se ha explicado antes elegiría dos candidatos que, dependiendo del criterio de búsqueda usado, podrían ser con la fecha de nacimiento del 5 de mayo de 1960 y el 17 de mayo de 1979. Para ambos candidatos, se genera después un documento de configuración de página como el que se ha explicado antes y este documento de configuración de página se introduce en un aparato clasificador preparado para reconocer los documentos de configuración de página que se han generado a partir de datos referentes al nacimiento a diferencia de los documentos de configuración de página que se han generado a partir de datos que, sin embargo, no son fechas de nacimiento.
Tal reconocimiento es posible ya que el documento de configuración de página que se ha generado a partir de una fecha de nacimiento contiene más indicaciones que permiten reconocerlos como documentos de configuración de página a partir de fechas de nacimiento en vez de otras fechas. Por ejemplo, es frecuente el caso en el que aparece la palabra "nacimiento" en los confines de la fecha de nacimiento, y si tenemos un documento en el que se incluye este término, hay otra indicación de que este es el documento de configuración de página que se ha generado a partir de una fecha de nacimiento. De manera similar, otros elementos que aparecen en los confines de la fecha de nacimiento pueden interpretarse también como una indicación, por ejemplo el término "lugar" o el término "de" como es el caso del ejemplo de la figura 5b. Sin embargo, si por ejemplo hay varias fechas de nacimiento en una columna de una tabla, conteniendo la parte superior de la columna el término "nacimiento", si se codifica la posición del término "nacimiento" como se ha explicado antes, éste se puede utilizar mediante un aparato clasificador como una indicación de que las fechas de esta columna son en realidad fechas de nacimiento. En general, el área circundante o los confines de un candidato para el que se genera un documento de configuración de página se puede utilizar como indicación para el contenido informativo real de tal candidato mediante un aparato clasificador. Teniendo en cuenta las indicaciones dadas por tal área circundante o cercana, se puede evaluar un conjunto de candidatos extraídos de un documento según cualquier criterio de búsqueda y si estos candidatos contienen en realidad la información que se busca.
Naturalmente, el documento de configuración de página se puede producir también directamente para todos los elementos de un documento de texto y después se puede evaluar cada elemento en base al documento de configuración de página que se ha generado de este modo, por ejemplo si éste pertenece a una cierta categoría o no. Sin embargo, si se usa una búsqueda de candidatos, primeramente se reducen los costes de cálculo que se producirían si se tuviera que producir un documento de texto para cada elemento del documento de texto.
A continuación se explica con más detalle el proceso de extracción y el proceso de preparación.
Una vez generado el documento de configuración de página, éste se puede usar para preparar una red neural o cualquier otro sistema informatizado que pueda decidir si un documento determinado pertenece o no a una categoría o clase determinada. Para este propósito, los documentos de configuración de página de los candidatos se introducen en la red neural o en cualquier otro aparato de decisión (aparato clasificador) junto con la información de si el documento de configuración de página corresponde o no a un candidato correcto, que quiere decir si el candidato tiene o no el contenido informativo deseado.
En la figura 8 se muestra esquemáticamente la preparación de tal red neural.
Un documento electrónico se analiza como se ha explicado antes para obtener elementos de un documento de texto y sus posiciones correspondientes. Después, preferiblemente se crea a partir de los mismos un documento basado en el texto, y un documento de trabajo. A continuación se realiza un filtrado para obtener a partir de los mismos un conjunto de candidatos que estén dentro de la categoría deseada. De manera preferible, el usuario corrige el conjunto obtenido manual o automáticamente, por ejemplo comprobando si un candidato obtenido se puede corregir más allá de un valor de umbral determinado. Para una corrección manual en la fase de preparación, los candidatos se tienen que destacar en el documento y el usuario puede confirmar después si alguno de ellos o todos ellos son correctos o no. La mencionada selección manual o automática de corrección de resultados deriva después en un conjunto de resultados correctos y en un conjunto de resultados incorrectos. Los documentos de configuración de página se generan para cada uno de los elementos del conjunto de resultados correctos y para cada uno de los elementos del conjunto de resultados incorrectos. Los documentos de configuración de página generados para el conjunto de resultados incorrectos y los documentos de configuración de página para el conjunto de resultados correctos se utilizan después para preparar la red neural. Si no se reconoce ningún candidato en absoluto, el usuario puede elegir por si mismo un candidato, destacarlo (por ejemplo con el ratón) y usarlo como entrada de preparación.
En la figura 9 se muestra un proceso de extracción usando una red que se ha preparado como se muestra en la figura 8. Un conjunto de candidatos se obtiene de manera similar a la figura 8 y se genera un documento de configuración de página para cada uno de los mismos como se ha explicado antes. Los documentos de configuración de página se utilizan después como entradas para la red neural preparada, que decide después si los candidatos pertenecen a la categoría deseada o no.
Una salida de la red puede consistir en los candidatos extraídos correctamente, o por ejemplo también en una consecuencia que sopesa la probabilidad de corrección de cada candidato. Los candidatos extraídos se pueden importar de o exportar directamente a otro documento electrónico, por ejemplo a una base de datos, un archivo MS-Excel, una tabla, un documento de Word o cualquier otro documento adecuado para un posterior procesamiento electrónico o similar.
El proceso de extracción que incluye la identificación de candidatos y la generación del documento de configuración de página se puede realizar como se ha explicado en detalle antes. El documento de configuración de página generado correspondiente se introduce, para todos los candidatos encontrados, en un aparato clasificador o de decisión que no tiene porque ser, pero es preferiblemente una red neural, y después se toma la decisión de si cada uno de los candidatos pertenece a la categoría correcta o no.
En la solicitud de patente europea 99108354.4 se describe un aparato particularmente adecuado para clasificar los documentos de configuración de página generados, ya pertenezcan a la categoría deseada o no, cuyo contenido completo se incorpora aquí como referencia. El aparato que se describe en ella puede clasificar documentos de texto representando los mismos como vectores, donde los valores de los componentes de los vectores corresponden a la frecuencia con la que se produce una determinada palabra o término en el documento. Tal vector que representa un documento se extiende sobre un espacio vectorial dimensional n, y varios documentos juntos también se extienden sobre un espacio vectorial determinado. La clasificación se realiza calculando un hiperplano que separa un espacio vectorial en al menos dos subespacios. Por tanto se puede realizar una clasificación en tantas clases como subespacios están presentes. Un proceso de preparación o aprendizaje consiste en establecer el espacio vectorial y el hiperplano de separación para un conjunto de documentos de aprendizaje, y después se puede clasificar un documento desconocido calculando si el vector correspondiente está dentro de un subespacio o en otro. Como con el método descrito antes en detalle es posible representar elementos de un documento de texto a través de un documento de configuración de página que ofrece indicaciones de sus áreas circundantes, y como el propio documento de configuración de página es de nuevo un documento de texto, se puede usar el aparato clasificador que se describe en la mencionada solicitud de patente europea para fines clasificatorios. Una aplicación preferida del aparato clasificador que se describe en la solicitud de patente descrita consiste en una red neural, por ejemplo en un Perceptrón. Otros detalles, como por ejemplo cómo se puede aplicar el aparato de decisión se pueden ver en esta solicitud y por tanto no se van a explicar aquí con más detalle.
Sin embargo, se debe entender que se puede utilizar cualquier otra red neural o cualquier otro método o aparato informático que pueda evaluar (clasificar) documentos teniendo en cuenta si éstos pertenecen a una categoría determinada o no para preparar documentos de configuración de página y después para tomar la decisión de si un candidato (o su documento de configuración de página correspondiente) tiene que considerarse como correctamente extraído o no. También debe entenderse que se puede utilizar cualquier otra presentación de documento de configuración de página en relación con la presente invención, no solamente los documentos en los que las posiciones se representan mediante secuencias de caracteres. También es perfectamente posible, por ejemplo, codificar las posiciones mediante números absolutos que representen las posiciones (coordenadas) o mediante ángulos y distancias (coordenadas polares).
Cualquier persona versada en la materia debe entender que la descripción detallada anterior sólo ilustra una realización ejemplar de la presente invención, y que otras realizaciones quedan perfectamente al alcance de los conocimientos generales de la persona cualificada. También debe quedar claro para aquellas personas versadas en la materia que el método de la presente invención puede aplicarse mediante cualquier sistema informático, mediante cualquier ordenador de características generales o mediante cualquier otro hardware especializado que lleve a cabo el método que se ha explicado antes. Por tanto, un aparato según la presente invención puede consistir en cualquier sistema informático que realice el método de la presente invención, mientras que el aparato consista, por ejemplo, en un sistema informático como el que se muestra en la figura 1. En la medida en que ciertos elementos de aparato o componentes de aparato se mencionan aquí o en las reivindicaciones anexas, pueden implementarse mediante un ordenador o parte de un ordenador que incluya o ejecute programas o partes de programas informáticos. Siempre que la presente invención se refiera a un programa informático o a un producto de un programa informático, debe quedar claro para cualquiera versado en la materia que cualquier soporte de datos o cualquier elemento informático tal como la memoria, una línea de transmisión, o similar que pueda incluir instrucciones de programa informático, puede constituir una realización de la presente invención siempre que puedan incluir instrucciones de programa informático que permitan a un ordenador ejecutar un método según la presente invención. La persona versada en la materia reconocerá que se pueden escribir muchos programas informáticos que trabajen según los principios que se han explicado aquí, por lo cual cualquier programa informático que trabaje según el método de la invención que se ha descrito debe considerarse como dentro del objeto de la presente invención.
Además, una estructura de datos que represente la estructura de un documento de configuración de página como el que se ha descrito, puede ser también una realización de la presente invención, independientemente de si está incorporada o incluida en un medio de almacenamiento, un soporte de datos, una línea de transmisión, una memoria tal como un ROM, RAM o similar.
Además, la presente invención puede usarse en una arquitectura de cliente-servidor, lo que significa que partes de un programa de ordenador que implementen la presente invención pueden ejecutarse en un servidor y otras partes pueden ejecutarse en un
\hbox{cliente.}
En la medida en que en la descripción anterior o en las reivindicaciones adjuntas se mencionen componentes de aparato, pueden ser realizados por un ordenador que desarrolle un programa de ordenador o ciertas instrucciones de programa, o pueden ser implementados por cualquier hardware especializado que desarrolle la función de tal componente, tal como un circuito electrónico, un ordenador de utilidad especial, o similar.
Para aquellos versados en la materia queda claro que se pueden realizar otras modificaciones y aplicaciones, y se debe entender que la presente solicitud se ha explicado mediante realizaciones ejemplares que no limitan el objeto de la presente invención.
En particular, se debe entender que el ejemplo de extraer una fecha de nacimiento no es más que un ejemplo, y el método que se ha explicado antes se puede utilizar para extraer cualquier elemento informativo que pertenezca a una categoría determinada de un documento de texto, como queda claro para el lector cualificado.

Claims (24)

1. Método implementado por ordenador para generar una entrada a utilizar por un aparato clasificador basada en un documento electrónico que comprende una pluralidad de elementos, caracterizado porque consiste en:
analizar dicho documento electrónico para obtener uno o más de dichos elementos junto con información de su posición correspondiente en dicho documento;
producir un documento electrónico de configuración de página para usarlo como dicha entrada en dicho aparato clasificador, comprendiendo dicho documento de configuración de página:
una representación de una pluralidad de dichos elementos obtenidos en dicha fase de análisis junto con información que representa su posición absoluta y/o relativa en dicho documento electrónico.
2. Método según la reivindicación 1, en donde dicho documento de configuración de página comprende:
una representación de un primer elemento de dicha pluralidad de elementos de dicho documento de texto junto con información que representa su posición absoluta y/o relativa en dicho documento electrónico, y
una representación de otros elementos de dicha pluralidad de elementos de dicho documento de texto junto con información que representa su posición absoluta y/o relativa en dicho documento electrónico, quedando situados los otros elementos mencionados dentro de un área predefinida o definida por el usuario que circunda y/o rodea dicho primer elemento.
3. Método según la reivindicación 1 ó 2 que comprende además:
buscar elementos que cumplan un criterio de búsqueda determinado para obtener elementos candidatos que, en lo que concierne a su contenido informativo, estén dentro de una cierta categoría, y
producir un documento de configuración de página para uno o más de dichos elementos candidatos.
4. Método según la reivindicación 3, en donde dicha fase de búsqueda de candidatos comprende además una o más de las siguientes etapas:
buscar elementos en dicho documento que correspondan a un cierto criterio de formato;
buscar palabras en dicho documento que correspondan a un cierto criterio de comparación en serie de caracteres;
realizar una búsqueda de palabras tolerante de fallos;
realizar una búsqueda de un elemento que tenga una posición relativa predefinida con respecto a un candidato encontrado;
realizar una búsqueda de una base de datos para buscar elementos que correspondan a palabras almacenadas en la base de datos.
5. Método según una de las reivindicaciones 1 a 4, que comprende además una o más de las siguientes etapas:
representar la posición de un elemento en dicho documento de configuración de página mediante una secuencia de caracteres correspondiente basada en un código de posición predefinido;
representar elementos que tengan un formato predefinido reconocible mediante una secuencia de caracteres basada en un código de formato predefinido;
representar elementos que tengan un significado reconocible mediante una secuencia de caracteres basada en un código de significación predefinido.
6. Método según la reivindicación 5, en donde dicho formato reconocido comprende uno o más:
renglones verticales y/u horizontales en dicho documento;
números con coma flotante;
fechas;
números enteros;
códigos postales.
7. Método según cualquiera de las reivindicaciones anteriores, en donde el área tenida en cuenta para producir dicho documento de configuración de página comprende una o más áreas geométricas cuyas dimensiones puede predefinir o fijar el usuario.
8. Método según cualquiera de las reivindicaciones 1 a 7, que comprende además:
utilizar dicho documento electrónico de configuración de página como una entrada para un aparato clasificador, para preparar dicho aparato clasificador o para evaluar dicha entrada mediante dicho aparato clasificador.
9. Método para extraer de un documento electrónico uno o más elementos que pertenecen a una categoría determinada, caracterizado porque comprende:
buscar elementos candidatos en dicho documento en base a uno o más criterios de búsqueda predefinidos;
para cada elemento candidato obtenido en dicha fase de búsqueda, producir un documento de configuración de página según cualquiera de las reivindicaciones anteriores; y
determinar si dicho candidato pertenece a dicha categoría en base al contenido informativo de dicho documento de configuración de página.
10. Método de preparación de un aparato clasificador para que aprenda a reconocer si un elemento de un documento pertenece a una cierta categoría o no, caracterizado porque comprende:
buscar elementos candidatos en dicho documento en base a uno o más criterios de búsqueda predefinidos;
para cada elemento candidato obtenido en dicha fase de búsqueda, producir un documento de configuración de página según cualquiera de las reivindicaciones anteriores; e
introducir dicha configuración de página junto con la información para saber si dicho candidato pertenece o no a la categoría en cuestión en el aparato clasificador para preparar dicho aparato clasificador.
11. Método según la reivindicación 9 ó 10, en donde dicho aparato clasificador es una red neural.
12. Aparato para producir una entrada a utilizar por un aparato clasificador basada en un documento electrónico que comprende una pluralidad de elementos, caracterizado porque comprende:
un analizador que analiza dicho documento electrónico para obtener uno o más de dichos elementos junto con información de su posición correspondiente en dicho documento;
un generador que produce un documento electrónico de configuración de página para ser usado cuando entre en dicho aparato clasificador, comprendiendo dicho documento de configuración de página:
una representación de una pluralidad de dichos elementos obtenidos en dicha fase de análisis con información que representa su posición absoluta y/o relativa en dicho documento electrónico.
13. Aparato según la reivindicación 12, en donde dicho documento de preparación de página comprende:
una representación de un primer elemento de dicha pluralidad de elementos de dicho documento de texto junto con información que representa su posición absoluta y/o relativa en dicho documento electrónico, y
una representación de otros elementos de dicha pluralidad de elementos de dicho documento de texto junto con información que representa su posición absoluta y/o relativa en dicho documento electrónico, quedando situados los otros elementos mencionados dentro de un área predefinida o definida por el usuario que circunda y/o rodea dicho primer elemento.
14. Aparato según la reivindicación 12 ó 13 que comprende además:
un buscador para buscar elementos que satisfagan un criterio de búsqueda determinado para obtener elementos candidatos que, en lo que concierne a su contenido informativo, estén dentro de una cierta categoría, y
produciendo dicho generador un documento de configuración de página para uno o más de dichos elementos candidatos.
15. Aparato según la reivindicación 14, en donde dicho buscador para buscar candidatos comprende además uno o más de los siguientes buscadores:
un buscador de elementos para buscar elementos en dicho documento que correspondan a un cierto criterio de formato;
un buscador de palabras para buscar palabras en dicho documento que correspondan a un cierto criterio de comparación en serie de caracteres;
un buscador de palabras que ejecute una búsqueda de palabras tolerante de fallos;
un buscador de elementos que ejecute una búsqueda de un elemento que tenga una posición relativa predefinida con respecto a un candidato encontrado;
un buscador de bases de datos que efectúe una búsqueda de bases de datos para buscar elementos que correspondan a palabras almacenadas en la base de datos.
16. Aparato según una de las reivindicaciones 12 a 15, en donde dicho generador de configuración de página está también adaptado para efectuar una de las siguientes tareas cuando produce dicho documento de configuración de página:
representar la posición de un elemento en dicho documento de configuración de página mediante una secuencia de caracteres correspondiente basada en un código de posición predefinido;
representar elementos que tengan un formato predefinido reconocible mediante una secuencia de caracteres basada en un código de formato predefinido;
representar elementos que tengan un significado reconocible mediante una secuencia de caracteres basada en un código de significación predefinido.
17. Aparato según la reivindicación 16, en donde dicho formato reconocible comprende uno o más:
renglones verticales y/u horizontales en dicho documento;
números con coma flotante;
fechas;
números enteros;
códigos postales.
18. Aparato según cualquiera de las reivindicaciones 12 a 17, en donde el área tenida en cuenta para producir dicho documento de configuración de página comprende una o más áreas geométricas cuyas dimensiones puede predefinir o fijar el usuario.
19. Aparato según cualquiera de las reivindicaciones 12 a 18, que comprende además:
dicho aparato clasificador que utiliza dicho documento electrónico de configuración de página como una entrada, para preparar dicho aparato clasificador o para evaluar dicha entrada mediante dicho aparato clasificador.
20. Aparato para extraer de un documento electrónico uno o más elementos que pertenecen a una categoría determinada, caracterizado porque comprende:
un buscador que busca elementos candidatos en dicho documento en base a uno o más criterios de búsqueda predefinidos;
un generador para cada elemento candidato obtenido en dicha fase de búsqueda, produciendo un documento de configuración de página según cualquiera de las reivindicaciones anteriores; y
un dispositivo de determinación para determinar si dicho candidato pertenece a dicha categoría en base al contenido informativo de dicho documento de configuración de página.
21. Aparato clasificador que se puede preparar para reconocer si un elemento de un documento pertenece o no a una cierta categoría, caracterizado porque comprende:
un buscador para buscar elementos candidatos en dicho documento en base a uno o más criterios de búsqueda predefinidos;
un generador para producir, para cada elemento candidato obtenido en dicha fase de búsqueda, un documento de configuración de página según cualquiera de las reivindicaciones anteriores; y
medios para introducir dicha configuración de página junto con la información para saber si dicho candidato pertenece o no a la categoría en cuestión en el aparato clasificador para preparar dicho aparato clasificador.
22. Aparato según la reivindicación 20 ó 21, en donde
dicho aparato clasificador es una red neural.
23. Programa informático que comprende un código de programa que puede ejecutar un ordenador, código de programa caracterizado porque está adaptado para hacer que dicho ordenador realice cualquiera de los métodos según una de las reivindicaciones 1 a 11.
24. Estructura de datos para utilizar como una entrada en un aparato clasificador, caracterizada porque se obtiene al ejecutar cualquiera de los métodos según cualquiera de las reivindicaciones 1 a 11.
ES00103810T 2000-02-23 2000-02-23 Metodo y aparato para procesar documentos electronicos. Expired - Lifetime ES2208164T3 (es)

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
EP00103810A EP1128278B1 (en) 2000-02-23 2000-02-23 Method and apparatus for processing electronic documents

Publications (1)

Publication Number Publication Date
ES2208164T3 true ES2208164T3 (es) 2004-06-16

Family

ID=8167944

Family Applications (1)

Application Number Title Priority Date Filing Date
ES00103810T Expired - Lifetime ES2208164T3 (es) 2000-02-23 2000-02-23 Metodo y aparato para procesar documentos electronicos.

Country Status (8)

Country Link
US (1) US20080040660A1 (es)
EP (2) EP1128278B1 (es)
JP (1) JP4782346B2 (es)
AU (3) AU2001233736A1 (es)
CA (1) CA2401172C (es)
DE (1) DE60005293T2 (es)
ES (1) ES2208164T3 (es)
WO (1) WO2001063467A1 (es)

Families Citing this family (19)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
EP1049030A1 (en) 1999-04-28 2000-11-02 SER Systeme AG Produkte und Anwendungen der Datenverarbeitung Classification method and apparatus
EP1182577A1 (en) 2000-08-18 2002-02-27 SER Systeme AG Produkte und Anwendungen der Datenverarbeitung Associative memory
US9177828B2 (en) 2011-02-10 2015-11-03 Micron Technology, Inc. External gettering method and device
AU2012258320B2 (en) * 2001-08-27 2016-01-14 Kofax International Switzerland Sàrl A method for automatically indexing documents
ES2375403T3 (es) 2001-08-27 2012-02-29 BDGB Enterprise Software Sàrl Un método para la indexación automática de documentos.
DE102004062784A1 (de) 2004-12-21 2006-07-20 Hiflex Software Gmbh Verfahren zum Auslösen einer Kostenbuchung
US7853595B2 (en) 2007-01-30 2010-12-14 The Boeing Company Method and apparatus for creating a tool for generating an index for a document
US8094976B2 (en) 2007-10-03 2012-01-10 Esker, Inc. One-screen reconciliation of business document image data, optical character recognition extracted data, and enterprise resource planning data
US8108764B2 (en) 2007-10-03 2012-01-31 Esker, Inc. Document recognition using static and variable strings to create a document signature
JP5412903B2 (ja) * 2009-03-17 2014-02-12 コニカミノルタ株式会社 文書画像処理装置、文書画像処理方法および文書画像処理プログラム
US9152883B2 (en) 2009-11-02 2015-10-06 Harry Urbschat System and method for increasing the accuracy of optical character recognition (OCR)
US9158833B2 (en) * 2009-11-02 2015-10-13 Harry Urbschat System and method for obtaining document information
US9213756B2 (en) 2009-11-02 2015-12-15 Harry Urbschat System and method of using dynamic variance networks
US8321357B2 (en) 2009-09-30 2012-11-27 Lapir Gennady Method and system for extraction
JP5387378B2 (ja) * 2009-12-15 2014-01-15 富士通株式会社 文字同定装置及び文字同定方法
US9002102B2 (en) * 2012-12-21 2015-04-07 Hewlett-Packard Development Company, L.P. Generating training documents
US9213893B2 (en) * 2013-05-23 2015-12-15 Intuit Inc. Extracting data from semi-structured electronic documents
US10482323B2 (en) * 2017-08-22 2019-11-19 Autonom8, Inc. System and method for semantic textual information recognition
US11568207B2 (en) * 2018-09-27 2023-01-31 Deepmind Technologies Limited Learning observation representations by predicting the future in latent space

Family Cites Families (103)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US4731861A (en) * 1983-08-26 1988-03-15 Texas Instruments Incorporated Method of optical character recognition
JPS61217863A (ja) * 1985-03-23 1986-09-27 Brother Ind Ltd 電子辞書
US4864501A (en) * 1987-10-07 1989-09-05 Houghton Mifflin Company Word annotation system
EP0320266A3 (en) * 1987-12-11 1992-03-11 Hewlett-Packard Company View composition in a data base management system
US5201047A (en) * 1989-12-21 1993-04-06 International Business Machines Corporation Attribute-based classification and retrieval system
US5191525A (en) * 1990-01-16 1993-03-02 Digital Image Systems, Corporation System and method for extraction of data from documents for subsequent processing
US5344132A (en) * 1990-01-16 1994-09-06 Digital Image Systems Image based document processing and information management system and apparatus
FR2660085A1 (fr) * 1990-03-20 1991-09-27 Philips Electronique Lab Dispositif de traitement de donnees et procede pour selectionner des mots de donnees contenus dans un dictionnaire.
JP3329806B2 (ja) * 1990-11-09 2002-09-30 株式会社日立製作所 ニューラルネット構築装置
US5278980A (en) * 1991-08-16 1994-01-11 Xerox Corporation Iterative technique for phrase query formation and an information retrieval system employing same
CA2077274C (en) * 1991-11-19 1997-07-15 M. Margaret Withgott Method and apparatus for summarizing a document without document image decoding
JP2579397B2 (ja) * 1991-12-18 1997-02-05 インターナショナル・ビジネス・マシーンズ・コーポレイション 文書画像のレイアウトモデルを作成する方法及び装置
US5245672A (en) * 1992-03-09 1993-09-14 The United States Of America As Represented By The Secretary Of Commerce Object/anti-object neural network segmentation
US5434953A (en) * 1992-03-20 1995-07-18 Xerox Corporation Use of fast textured reduction for discrimination of document image components
US5748807A (en) * 1992-10-09 1998-05-05 Panasonic Technologies, Inc. Method and means for enhancing optical character recognition of printed documents
US5491758A (en) * 1993-01-27 1996-02-13 International Business Machines Corporation Automatic handwriting recognition using both static and dynamic parameters
US5649068A (en) * 1993-07-27 1997-07-15 Lucent Technologies Inc. Pattern recognition system using support vectors
GB2281997B (en) * 1993-09-20 1997-10-15 Ricoh Kk Method and apparatus for improving a text image by using character regeneration
US5619709A (en) * 1993-09-20 1997-04-08 Hnc, Inc. System and method of context vector generation and retrieval
US5537491A (en) * 1993-11-24 1996-07-16 Xerox Corporation Analyzing an image or other data to obtain a stable number of groups
US5742806A (en) * 1994-01-31 1998-04-21 Sun Microsystems, Inc. Apparatus and method for decomposing database queries for database management system including multiprocessor digital data processing system
NZ248751A (en) * 1994-03-23 1997-11-24 Ryan John Kevin Text analysis and coding
US5671333A (en) * 1994-04-07 1997-09-23 Lucent Technologies Inc. Training apparatus and method
JP2618832B2 (ja) * 1994-06-16 1997-06-11 日本アイ・ビー・エム株式会社 文書の論理構造の解析方法及びシステム
US5574802A (en) * 1994-09-30 1996-11-12 Xerox Corporation Method and apparatus for document element classification by analysis of major white region geometry
US5689620A (en) * 1995-04-28 1997-11-18 Xerox Corporation Automatic training of character templates using a transcription and a two-dimensional image source model
US5956419A (en) * 1995-04-28 1999-09-21 Xerox Corporation Unsupervised training of character templates using unsegmented samples
US5675710A (en) * 1995-06-07 1997-10-07 Lucent Technologies, Inc. Method and apparatus for training a text classifier
US5778397A (en) * 1995-06-28 1998-07-07 Xerox Corporation Automatic method of generating feature probabilities for automatic extracting summarization
US6006221A (en) * 1995-08-16 1999-12-21 Syracuse University Multilingual document retrieval system and method using semantic vector matching
US5889886A (en) * 1995-11-28 1999-03-30 Xerox Corporation Method and apparatus for detecting running text in an image
US6009196A (en) * 1995-11-28 1999-12-28 Xerox Corporation Method for classifying non-running text in an image
US6076088A (en) * 1996-02-09 2000-06-13 Paik; Woojin Information extraction system and method using concept relation concept (CRC) triples
US5864855A (en) * 1996-02-26 1999-01-26 The United States Of America As Represented By The Secretary Of The Army Parallel document clustering process
JP2987099B2 (ja) * 1996-03-27 1999-12-06 株式会社日立国際ビジネス 文書作成支援システム及び用語辞書
US5787201A (en) * 1996-04-09 1998-07-28 The United States Of America As Represented By The Secretary Of The Navy High order fractal feature extraction for classification of objects in images
US5937084A (en) * 1996-05-22 1999-08-10 Ncr Corporation Knowledge-based document analysis system
US5835638A (en) * 1996-05-30 1998-11-10 Xerox Corporation Method and apparatus for comparing symbols extracted from binary images of text using topology preserved dilated representations of the symbols
US6101515A (en) * 1996-05-31 2000-08-08 Oracle Corporation Learning system for classification of terminology
US5778362A (en) * 1996-06-21 1998-07-07 Kdl Technologies Limted Method and system for revealing information structures in collections of data items
DE19627472A1 (de) * 1996-07-08 1998-01-15 Ser Systeme Ag Datenbanksystem
US5918223A (en) * 1996-07-22 1999-06-29 Muscle Fish Method and article of manufacture for content-based analysis, storage, retrieval, and segmentation of audio information
US5745889A (en) * 1996-08-09 1998-04-28 Digital Equipment Corporation Method for parsing information of databases records using word-location pairs and metaword-location pairs
WO1998012616A2 (en) * 1996-09-23 1998-03-26 Lowrie Mcintosh Defining a uniform subject classification system incorporating document management/records retention functions
US6275610B1 (en) * 1996-10-16 2001-08-14 Convey Corporation File structure for scanned documents
JPH10240958A (ja) * 1996-12-27 1998-09-11 Fujitsu Ltd 画像から管理情報を抽出する管理情報抽出装置および方法
US6327387B1 (en) * 1996-12-27 2001-12-04 Fujitsu Limited Apparatus and method for extracting management information from image
US6687404B1 (en) * 1997-06-20 2004-02-03 Xerox Corporation Automatic training of layout parameters in a 2D image model
US6353840B2 (en) * 1997-08-15 2002-03-05 Ricoh Company, Ltd. User-defined search template for extracting information from documents
US6665841B1 (en) * 1997-11-14 2003-12-16 Xerox Corporation Transmission of subsets of layout objects at different resolutions
US5999664A (en) * 1997-11-14 1999-12-07 Xerox Corporation System for searching a corpus of document images by user specified document layout components
US5987457A (en) * 1997-11-25 1999-11-16 Acceleration Software International Corporation Query refinement method for searching documents
US6115708A (en) * 1998-03-04 2000-09-05 Microsoft Corporation Method for refining the initial conditions for clustering with applications to small and large database clustering
JP3422924B2 (ja) * 1998-03-27 2003-07-07 富士通株式会社 文字認識装置、文字認識方法およびその方法をコンピュータに実行させるプログラムを記録したコンピュータ読み取り可能な記録媒体
US6161130A (en) * 1998-06-23 2000-12-12 Microsoft Corporation Technique which utilizes a probabilistic classifier to detect "junk" e-mail by automatically updating a training and re-training the classifier based on the updated training set
US6192360B1 (en) * 1998-06-23 2001-02-20 Microsoft Corporation Methods and apparatus for classifying text and for building a text classifier
US6243713B1 (en) * 1998-08-24 2001-06-05 Excalibur Technologies Corp. Multimedia document retrieval by application of multimedia queries to a unified index of multimedia data for a plurality of multimedia data types
US6324551B1 (en) * 1998-08-31 2001-11-27 Xerox Corporation Self-contained document management based on document properties
US6212532B1 (en) * 1998-10-22 2001-04-03 International Business Machines Corporation Text categorization toolkit
US6574632B2 (en) * 1998-11-18 2003-06-03 Harris Corporation Multiple engine information retrieval and visualization system
US6622134B1 (en) * 1999-01-05 2003-09-16 International Business Machines Corporation Method of constructing data classifiers and classifiers constructed according to the method
WO2000042563A2 (en) * 1999-01-13 2000-07-20 Computer Associates Think, Inc. Signature recognition system and method
US6477551B1 (en) * 1999-02-16 2002-11-05 International Business Machines Corporation Interactive electronic messaging system
US6629097B1 (en) * 1999-04-28 2003-09-30 Douglas K. Keith Displaying implicit associations among items in loosely-structured data sets
EP1049030A1 (en) * 1999-04-28 2000-11-02 SER Systeme AG Produkte und Anwendungen der Datenverarbeitung Classification method and apparatus
US6611825B1 (en) * 1999-06-09 2003-08-26 The Boeing Company Method and system for text mining using multidimensional subspaces
US6501855B1 (en) * 1999-07-20 2002-12-31 Parascript, Llc Manual-search restriction on documents not having an ASCII index
US6785810B1 (en) * 1999-08-31 2004-08-31 Espoc, Inc. System and method for providing secure transmission, search, and storage of data
US6453315B1 (en) * 1999-09-22 2002-09-17 Applied Semantics, Inc. Meaning-based information organization and retrieval
US6990238B1 (en) * 1999-09-30 2006-01-24 Battelle Memorial Institute Data processing, analysis, and visualization system for use with disparate data types
US6188010B1 (en) * 1999-10-29 2001-02-13 Sony Corporation Music search by melody input
DE19952769B4 (de) * 1999-11-02 2008-07-17 Sap Ag Suchmaschine und Verfahren zum Abrufen von Informationen mit Abfragen in natürlicher Sprache
US6694053B1 (en) * 1999-12-02 2004-02-17 Hewlett-Packard Development, L.P. Method and apparatus for performing document structure analysis
US7149347B1 (en) * 2000-03-02 2006-12-12 Science Applications International Corporation Machine learning of document templates for data extraction
US7213024B2 (en) * 2000-03-09 2007-05-01 The Web Access, Inc. Method and apparatus for accessing information within an electronic system
US6741724B1 (en) * 2000-03-24 2004-05-25 Siemens Dematic Postal Automation, L.P. Method and system for form processing
US20070033252A1 (en) * 2000-03-30 2007-02-08 Combest Ricky F Dynamic virtual network and method
JP2001318948A (ja) * 2000-05-09 2001-11-16 Hitachi Ltd 文書検索方法及び装置並びにその処理プログラムを記憶した媒体
WO2001090921A2 (en) * 2000-05-25 2001-11-29 Kanisa, Inc. System and method for automatically classifying text
US6895552B1 (en) * 2000-05-31 2005-05-17 Ricoh Co., Ltd. Method and an apparatus for visual summarization of documents
US6944340B1 (en) * 2000-08-07 2005-09-13 Canon Kabushiki Kaisha Method and apparatus for efficient determination of recognition parameters
EP1182577A1 (en) * 2000-08-18 2002-02-27 SER Systeme AG Produkte und Anwendungen der Datenverarbeitung Associative memory
US6766316B2 (en) * 2001-01-18 2004-07-20 Science Applications International Corporation Method and system of ranking and clustering for document indexing and retrieval
US20020156816A1 (en) * 2001-02-13 2002-10-24 Mark Kantrowitz Method and apparatus for learning from user self-corrections, revisions and modifications
US6732090B2 (en) * 2001-08-13 2004-05-04 Xerox Corporation Meta-document management system with user definable personalities
ES2375403T3 (es) * 2001-08-27 2012-02-29 BDGB Enterprise Software Sàrl Un método para la indexación automática de documentos.
JP4006239B2 (ja) * 2002-02-21 2007-11-14 株式会社日立製作所 文書の検索方法および検索システム
JP4366108B2 (ja) * 2003-04-30 2009-11-18 キヤノン株式会社 文書検索装置、文書検索方法及びコンピュータプログラム
JP2005043977A (ja) * 2003-07-23 2005-02-17 Hitachi Ltd 文書間の類似度算出方法および装置
US7805446B2 (en) * 2004-10-12 2010-09-28 Ut-Battelle Llc Agent-based method for distributed clustering of textual information
US8570586B2 (en) * 2005-05-02 2013-10-29 Digimarc Corporation Active images through digital watermarking
US7472121B2 (en) * 2005-12-15 2008-12-30 International Business Machines Corporation Document comparison using multiple similarity measures
US8090743B2 (en) * 2006-04-13 2012-01-03 Lg Electronics Inc. Document management system and method
WO2007149004A1 (en) * 2006-06-13 2007-12-27 Freescale Semiconductor, Inc. Methods and apparatus for simulating distributed effects
US7945627B1 (en) * 2006-09-28 2011-05-17 Bitdefender IPR Management Ltd. Layout-based electronic communication filtering systems and methods
US7610281B2 (en) * 2006-11-29 2009-10-27 Oracle International Corp. Efficient computation of document similarity
US7720721B1 (en) * 2006-12-28 2010-05-18 Amazon Technologies, Inc. Method and system for analyzing user interaction to identify documents associated with dissimilar items that may contain synonyms
WO2008097194A1 (en) * 2007-02-09 2008-08-14 Agency For Science, Technology And Research Keyword classification and determination in language modelling
US8280877B2 (en) * 2007-02-22 2012-10-02 Microsoft Corporation Diverse topic phrase extraction
US20080212877A1 (en) * 2007-03-04 2008-09-04 John Franco High speed error detection and correction for character recognition
US20090228777A1 (en) * 2007-08-17 2009-09-10 Accupatent, Inc. System and Method for Search
US20090198677A1 (en) * 2008-02-05 2009-08-06 Nuix Pty.Ltd. Document Comparison Method And Apparatus
JP4538507B2 (ja) * 2008-05-02 2010-09-08 シャープ株式会社 画像照合方法、画像照合装置、画像データ出力処理装置、プログラム及び記憶媒体

Also Published As

Publication number Publication date
EP1259903A1 (en) 2002-11-27
AU2007202382A1 (en) 2007-06-14
CA2401172A1 (en) 2001-08-30
JP4782346B2 (ja) 2011-09-28
WO2001063467A1 (en) 2001-08-30
AU2001233736A1 (en) 2001-09-03
DE60005293D1 (de) 2003-10-23
CA2401172C (en) 2012-01-24
AU2009208162A1 (en) 2009-09-10
DE60005293T2 (de) 2004-07-01
EP1128278A1 (en) 2001-08-29
JP2003524258A (ja) 2003-08-12
AU2007202382B2 (en) 2009-06-04
EP1128278B1 (en) 2003-09-17
US20080040660A1 (en) 2008-02-14

Similar Documents

Publication Publication Date Title
AU2007202382B2 (en) Method and apparatus for processing electronic documents
Ha et al. Information extraction from scanned invoice images using text analysis and layout features
Das et al. A statistical–topological feature combination for recognition of handwritten numerals
Mouchère et al. Advancing the state of the art for handwritten math recognition: the CROHME competitions, 2011–2014
EP1362322B1 (en) Holistic-analytical recognition of handwritten text
US20110103689A1 (en) System and method for obtaining document information
Saabni et al. Comprehensive synthetic Arabic database for on/off-line script recognition research
US20150310269A1 (en) System and Method of Using Dynamic Variance Networks
Lee et al. Deep learning-based digitalization of a part catalog book to generate part specification by a neutral reference data dictionary
Fischer Handwriting recognition in historical documents
US20230419706A1 (en) Method to identify and extract tables from semi-structured documents
Nayak et al. Odia running text recognition using moment-based feature extraction and mean distance classification technique
Assabie et al. Writer-independent offline recognition of handwritten Ethiopic characters
Nagy et al. Adaptive and interactive approaches to document analysis
Madhvanath et al. Perceptual features for off-line handwritten word recognition: a framework for heuristic prediction, representation and matching
Indermühle Analysis of digital link in electronic documents
Balasooriya Improving and Measuring OCR Accuracy for Sinhala with Tesseract OCR Engine
JP7410532B2 (ja) 文字判定装置及び文字判定プログラム
Kaur et al. Adverse conditions and techniques for cross-lingual text recognition
JPWO2017013719A1 (ja) 文字認識装置、文字認識方法及び文字認識プログラム
Prasad et al. Trends in handwriting recognition
US20250391192A1 (en) Information processing apparatus, non-transitory computer readable recording medium, and information processing method
Krayem A high level approach to Arabic sentence recognition
Kumar et al. Preparation of a dataset and issues related with recognition of optical character in as samese script
Imama et al. A Slice-based Character Recognition Technique for Handwritten Devanagari Script