ES2208164T3 - Metodo y aparato para procesar documentos electronicos. - Google Patents
Metodo y aparato para procesar documentos electronicos.Info
- Publication number
- ES2208164T3 ES2208164T3 ES00103810T ES00103810T ES2208164T3 ES 2208164 T3 ES2208164 T3 ES 2208164T3 ES 00103810 T ES00103810 T ES 00103810T ES 00103810 T ES00103810 T ES 00103810T ES 2208164 T3 ES2208164 T3 ES 2208164T3
- Authority
- ES
- Spain
- Prior art keywords
- document
- elements
- search
- candidate
- page
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired - Lifetime
Links
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V30/00—Character recognition; Recognising digital ink; Document-oriented image-based pattern recognition
- G06V30/40—Document-oriented image-based pattern recognition
Landscapes
- Engineering & Computer Science (AREA)
- Computer Vision & Pattern Recognition (AREA)
- Artificial Intelligence (AREA)
- Physics & Mathematics (AREA)
- General Physics & Mathematics (AREA)
- Multimedia (AREA)
- Theoretical Computer Science (AREA)
- Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
- Document Processing Apparatus (AREA)
- Financial Or Insurance-Related Operations Such As Payment And Settlement (AREA)
Abstract
Método implementado por ordenador para generar una entrada a utilizar por un aparato clasificador basada en un documento electrónico que comprende una pluralidad de elementos, caracterizado porque consiste en: analizar dicho documento electrónico para obtener uno o más de dichos elementos junto con información de su posición correspondiente en dicho documento; producir un documento electrónico de configuración de página para usarlo como dicha entrada en dicho aparato clasificador, comprendiendo dicho documento de configuración de página: una representación de una pluralidad de dichos elementos obtenidos en dicha fase de análisis junto con información que representa su posición absoluta y/o relativa en dicho documento electrónico.
Description
Método y aparato para procesar documentos
electrónicos.
La presente solicitud se relaciona con la
solicitud de patente europea con número de solicitud 99108354.4
presentada el 28 de abril de 1999.
La presente invención se refiere a un método y
aparato para procesar documentos electrónicos y, en particular,
para extraer ciertos elementos de documentos de texto
electrónicos.
El procesamiento de documentos electrónicos (EDP)
es más importante cada día para hacer frente al gran volumen de
documentos que tienen que manipular entidades tales como grandes
corporaciones, oficinas de administración y similares. Hoy en día es
común tener los documentos en forma electrónica, lo que puede ser
el resultado de un proceso de escaneo y de un posterior proceso de
reconocimiento óptico de caracteres (OCR) para transformar los
documentos escritos a una forma electrónica.
Si se tiene que manipular un gran volumen de
tales documentos, por ejemplo para almacenar datos específicos que
se encuentran en ellos de un modo ordenado, por ejemplo una base de
datos, es conveniente que se puedan sacar de manera automática
algunos datos (elementos del documento), por ejemplo la fecha de
nacimiento, el lugar de nacimiento, o similar, de tales documentos
electrónicos. Por ejemplo, si una empresa quiere procesar
automáticamente un gran volumen de currículum vitae, podría ser
conveniente sacar esos datos de manera automática de los documentos
electrónicos. Además, para otros fines, por ejemplo para sacar
información de contabilidad para sistemas ERP, podría ser
conveniente la extracción de datos de los documentos de texto.
Existen muchas aplicaciones imaginables, para las que podría ser
deseable tener una cierta información del texto o de los elementos
del texto, o de ciertos números o información de números extraídos
de un documento de texto. El documento de texto puede ser, por
ejemplo, cualquier documento que contenga ciertos datos de interés
que tienen que sacarse debido a que pertenecen a una cierta
categoría de información.
Los sistemas de extracción convencionales que
pueden extraer datos específicos de documentos de texto
electrónicos operan de manera que tienen que buscar una posición
fija en un documento donde se supone que están colocados los
datos.
Tal tipo de algoritmos de búsqueda no funciona
muy bien, ya que depende en gran medida de documentos con un
formato predefinido donde los datos buscados siempre están colocados
en el mismo lugar.
La patente estadounidense 5,191,525, describe un
sistema para procesar automáticamente documentos de papel basado en
una extracción automática y un procesamiento de datos presentes en
dichos documentos. Con ese propósito, los documentos se pasan
primero a un formato electrónico. El sistema puede manipular
diferentes tipos de documentos, y primero hay que identificar el
tipo de documento. Para ese propósito, existen áreas de
identificación geográfica previstas que contienen una palabra o
varias palabras de identificación específicas, basada en las cuales
se hace la identificación del tipo de documento. Después de
identificado el tipo de documento, y tomando como base los
conocimientos que se tienen de la composición de este tipo de
documento, se realiza una división de las áreas de datos gráficos
que se han extraído de la imagen gráfica. Estas áreas se envían al
subsistema de reconocimiento y, dependiendo del buen conocimiento
que ya se tiene del tipo de documento, pueden contener un cierto
tipo de datos que pueden usarse después para procesar este
documento. Este sistema que se ha descrito también depende de un
conocimiento a priori de la composición de los documentos
individuales, en particular del emplazamiento donde se puede esperar
un cierto tipo de datos dentro de un cierto tipo de documento.
Por tanto, un objeto de la presente invención es
mejorar los métodos convencionales de extracción de ciertos datos
de documentos de texto.
La presente invención, según un aspecto de la
misma, proporciona un método y un aparato para generar un documento
de configuración de página que representa un elemento del documento
de texto que se puede usar como una entrada para un aparato
clasificador. Debido al tipo particular del documento de
configuración de página generado según este aspecto de la presente
invención, el aparato clasificador puede ejecutar una clasificación
mejorada de un elemento del texto representado por el documento de
configuración de página. Por tanto, es posible una extracción
mejorada de ciertos elementos de texto del documentos de texto.
Según un aspecto de la presente invención, se
genera un documento de configuración de página basado en los
elementos de un documento de texto electrónico, conteniendo la
configuración de página una representación de elementos de dicho
documento junto con representaciones de su posición
correspondiente. Al generarse dicho documento de configuración de
página que se puede usar como una entrada para un aparato
clasificador, por ejemplo una red neural, es posible evaluar los
elementos de un documento junto con sus elementos de contexto
geométricos (cercanos/circundantes) y hacer así uso no sólo del
formato o del contenido de un elemento por sí mismo sino también de
otra información para evaluar si el elemento pertenece o no a una
categoría determinada. Teniendo en cuenta no sólo un elemento o su
formato, sino también su área circundante, es decir, los elementos
que se encuentran dentro del área circundante, un aparato
clasificador recibe más indicaciones de si un elemento de texto
pertenece o no a una categoría determinada. Esas indicaciones
adicionales que proporciona el área circundante y los elementos de
texto que se encuentran en ella, pueden reconocerse o aprenderse
mediante un aparato clasificador, por ejemplo una red neural, y así
una red neural preparada puede proporcionar una clasificación
mejorada y en consecuencia una extracción mejorada de elementos de
los documentos de texto.
Según otro aspecto de la presente invención, se
generan configuraciones de página para una pluralidad de elementos
que pertenecen a una categoría determinada, y las configuraciones de
página generadas se utilizan después para preparar el aparato
clasificador con el fin de reconocer elementos de esa categoría. De
manera preferible, el aparato clasificador es una red neural que se
prepara mediante las configuraciones de página generadas para una
pluralidad de elementos, y mediante entradas en el aparato en la
fase de preparación ya pertenezcan o no los elementos para los que
se han generado las configuraciones de página a una determinada
categoría. Una red neural o aparato clasificador preparado de este
modo se puede utilizar también para clasificar elementos de un
texto desconocido y para extraer elementos de textos
desconocidos.
Según otro aspecto de la presente invención, un
aparato clasificador que se ha preparado, se utiliza para evaluar
si un elemento desconocido pertenece o no a una categoría
determinada basado en un documento de configuración de página
generado para este elemento, con el fin de extraer de este modo
elementos de un documento que pertenecen a una categoría
determinada.
Según otro aspecto de la presente invención, se
identifican candidatos que, dependiendo de un determinado criterio
de búsqueda, podrían pertenecer a la categoría a la que deberían
pertenecer los datos extraídos. De manera preferible, un criterio
de búsqueda puede ser un formato de un elemento, un criterio de
búsqueda de palabra, un criterio de búsqueda de palabra tolerante de
fallo, o una combinación de tales criterios. Para cada uno de estos
candidatos, se puede generar después un documento de configuración
de página basado en el propio candidato, su posición en el documento
electrónico, y en base a otros elementos del documento electrónico y
su posición en dicho documento. De manera preferible, cuando se
genera el documento de configuración de página, se tienen en cuenta
los elementos que están dentro de una o más áreas predefinidas,
preferiblemente las que están cerca de o rodeando al candidato.
Tomando como base tal documento de configuración
de página, se juzga después si el candidato pertenece o no en
realidad a la categoría deseada.
Según una realización preferida de la presente
invención, la decisión de si dicho candidato pertenece o no a la
categoría deseada se hace usando un aparato clasificador que es
preferiblemente una red neural. La red neural puede haberse
preparado usando documentos de configuración de página de
candidatos y comunicando además a la red neural como una entrada
si los candidatos pertenecen o no a la categoría deseada.
Según otra realización preferida, la decisión de
si un candidato pertenece o no a la categoría deseada se hace
usando un método o un aparato como en el que se describe en la
solicitud de patente europea 99108354.4, solicitada el 28 de abril
de 1999, cuya prioridad se reivindica para la presente solicitud, y
que se incorpora aquí como referencia.
La figura 1, muestra un sistema informático que
se puede utilizar para aplicar una realización según la presente
invención.
La figura 2, ilustra un ejemplo de un documento
de texto del cual se van a extraer elementos.
La figura 3, muestra un ejemplo de un documento
de trabajo creado a partir de un documento de texto.
La figura 4, muestra un ejemplo de una interfaz
de usuario para la definición de un área de configuración de
página.
La figura 5a, muestra un ejemplo de un área de
configuración de página.
La figura 5b, muestra un ejemplo de un documento
de configuración de página.
La figura 6, muestra un ejemplo de un código para
codificar un recuadro de candidato.
La figura 7, muestra un ejemplo para codificar
las posiciones de los elementos de un documento de configuración de
página.
La figura 8, muestra un ejemplo de una fase de
aprendizaje de un aparato clasificador.
La figura 9, muestra un ejemplo de una fase de
extracción de un aparato clasificador.
La presente invención se puede aplicar mediante
un sistema informático como el que se muestra en la figura 1.
La figura 1 muestra esquemáticamente la
configuración de un sistema informático para usar en la realización
preferida de la presente invención. El ordenador 100 contiene una
CPU 110, una memoria 120 y una unidad I/O 130. El ordenador 100
puede ejecutar programas siguiendo las instrucciones de ordenador de
la CPU 110 que la CPU extrae de la memoria 120 y que se pueden haber
almacenado en un dispositivo de almacenamiento 150 tal como un
CD-ROM o un disquete. La unidad I/O está conectada a
un teclado 160 y a un ratón 170 para permitir al usuario que
introduzca datos en el ordenador, y está conectada también a una
impresora 180 para producir documentos tales como documentos
impresos. El ordenador 100 está conectado también a una unidad de
visualización 140 tal como un monitor. Se debe entender que la
configuración del ordenador mostrada en la figura 1 es únicamente un
ejemplo y que en la presente invención pueden usarse otras
configuraciones de ordenador, tales como por ejemplo ordenadores de
procesamiento paralelos, ordenadores de red neural con hardware
especializado o cualquier otro sistema informático que pueda
realizar el método explicado antes.
A partir de ahora, la presente invención se
describe para la extracción de una fecha de nacimiento de un
curriculum vitae como el que se muestra en la figura 2.
Cualquier persona versada en la materia puede entender fácilmente
que la descripción de la presente invención en relación con la
extracción de una fecha de nacimiento de un curriculum vitae
se hace sólo con propósitos explicativos, y que el mismo método y
aparato que se describen a partir de ahora se pueden aplicar a
cualquier otro documento de texto del que se van a extraer ciertas
informaciones tales como, por ejemplo, un número de cuenta bancaria
de un estado contable, precios de facturas, valores de existencias
en fábrica a partir de los documentos correspondientes, etc.
El curriculum vitae está almacenado en un
ordenador o en un soporte de datos en forma electrónica y puede
haber sido el resultado de una edición usando un procesador de
textos, o el documento electrónico puede ser el resultado de un
proceso de exploración y de un proceso de reconocimiento de
caracteres ópticos posterior. En vez del curriculum vitae,
se puede utilizar cualquier documento del que se pueda extraer un
elemento que tenga un significado específico o que esté dentro de
una cierta categoría.
Al principio, el documento electrónico se analiza
para obtener los elementos individuales que lo componen. Aquí,
"elemento" quiere decir cualquier secuencia de caracteres que
se separa de otros elementos mediante un delimitador, tal como por
ejemplo un espacio, un tabulador, un subrayado o cualquier otra
cosa, que pueda interpretarse como delimitador entre dos
elementos. El modo más sencillo de separar un texto en elementos
individuales consiste en identificar las partes textuales como
elementos que se han separado entre si mediante un espacio en
blanco (un espacio). Sin embargo, dependiendo de la finalidad del
análisis, se pueden tener en cuenta también otros criterios tales
como el subrayado ya mencionado, un guión, una vuelta del carro u
otras partes del documento electrónico que puedan considerarse como
delimitadores de elementos. Otro criterio que podría tenerse en
cuenta cuando se van a identificar elementos individuales podría ser
la distancia geométrica entre caracteres individuales. Por ejemplo,
se podría definir un valor umbral más allá del cual una distancia
entre dos caracteres se interpreta como que los dos caracteres son
elementos diferentes. En el presente ejemplo, aceptamos que un
elemento es cualquier carácter individual o secuencia de
caracteres separados de otros "elementos" mediante un
espacio.
En el presente ejemplo de un documento de texto
como el que se muestra en la figura 2, los dos primeros elementos
serían "curriculum" y "vitae", otros
elementos serían: "teléfono", "fax", etc, como queda claro
para los versados en la materia. Los elementos se identifican, por
ejemplo, mediante un analizador que busca espacios.
Además de obtener los elementos por si mismos, se
obtiene su posición correspondiente en el documento, por ejemplo
calculando las coordenadas "x" e "y" de la situación de
cada elemento en el documento. La posición se utiliza después para
producir el documento de configuración de página.
Después de haber identificado los elementos
individuales del documento de texto electrónico, estos elementos se
almacenan en el denominado "documento de trabajo". En el
documento de trabajo, cada elemento identificado, se almacena junto
con datos que tienen que ver con su posición en el documento
electrónico. Por ejemplo, el elemento "curriculum"
puede almacenarse junto con sus coordenadas "x" e "y" que
identifican su posición en el documento electrónico. El documento de
trabajo es una herramienta útil para almacenar todos los elementos
que se han identificado junto con su posición correspondiente, con
lo cual se puede producir el documento de configuración de página
que se va a explicar después en detalle en el documento de trabajo.
Un ejemplo de un documento de trabajo generado a partir de un
documento de texto se muestra en la figura 3. Las etiquetas:
etiqueta 1, etiqueta 2, etc., contienen la información de la
posición de los elementos correspondientes. Esta información se
puede representar de cualquier manera, por ejemplo almacenando
directamente las coordenadas "x" e "y" de los elementos
en las etiquetas. Los elementos de la figura 3 pueden ser, por
ejemplo, las palabras individuales identificadas en un documento de
texto, o cualquier otra secuencia de caracteres identificados como
elementos con el método explicado antes, y las etiquetas contienen
información de la posición de dichos elementos, por ejemplo dónde
están situados según sus coordenadas "x" e "y". Las
etiquetas pueden comprender también indicaciones del estilo de los
elementos, su familia de caracteres, si están subrayados o no, o
cualquier otra información similar. Por ejemplo, para un elemento en
negrita, la etiqueta correspondiente puede comprender la secuencia
de caracteres "bf" que representa ese elemento en caracteres
en negrita, otra secuencia de caracteres puede representar que el
elemento está subrayado, o similar.
La posición de un elemento puede representar, por
ejemplo, el centro de gravedad de un elemento calculado según su
valor en píxeles o cualquier otra información geométrica del
emplazamiento del elemento. Por ejemplo, se puede construir un
recuadro que rodee el elemento, y la media entre las coordenadas
"x" máxima y mínima del recuadro considerarse como coordenada
"x", y la media entre las coordenada "y" máxima y mínima
del recuadro considerarse como coordenada "y" del elemento
cuando se representa su posición en el texto mediante una etiqueta
correspondiente del documento de trabajo.
El documento de trabajo contiene una lista de los
elementos identificados junto con las etiquetas que indican su
posición correspondiente y posiblemente también más información
como se ha mencionado antes, por ejemplo más información sobre la
familia de los elementos, su estilo, si están subrayados o no,
etc.
De este modo se crea el documento de trabajo que
contiene una lista de los elementos individuales del documento de
texto electrónico junto con su posición correspondiente y
posiblemente también otras informaciones. Además, se pueden
incorporar elementos no textuales en el documento de trabajo, por
ejemplo líneas o cuadrículas horizontales o verticales contenidas
en el documento electrónico, que se almacenan después en el
documento de trabajo de modo que se representa su posición y su
forma (horizontal, vertical, cuadrícula o similar) según un código.
Por ejemplo, en un documento de trabajo se puede representar una
línea horizontal mediante una secuencia de caracteres AAAA; una
línea vertical mediante una secuencia de caracteres BBBB, cada una
de las cuales seguida de una etiqueta que indica la posición de la
línea.
El documento creado de este modo puede utilizarse
después para identificar elementos candidatos que posiblemente
podrían ser el elemento a extraer. Con este propósito, se analiza
el documento de trabajo (o posiblemente también el "documento
original" en que se basa el documento de trabajo) para
identificar los elementos que cumplen un cierto criterio de
búsqueda, por ejemplo un criterio formal. En esta fase de extracción
de un candidato, se analizan todos los elementos para encontrar
posibles candidatos para los elementos deseados a extraer.
De manera preferible, no sólo se buscan elementos
individuales sino también combinaciones de elementos, por lo cual el
método puede incluir espacios entre los elementos individuales. Por
ejemplo, cuando se busca un número de cuenta bancaria, que se
supone que tiene ocho dígitos, se puede realizar una búsqueda de un
número que tenga ocho dígitos que pueden representarse como
"99999999" o como "999 999 99" o como "9 9 9 9 9 9 9
9" o cualquier otra combinación. Por tanto, la búsqueda de tal
número de cuenta bancaria se puede realizar, por ejemplo, buscando
un número que tenga ocho dígitos. Dependiendo del contenido
informativo que tenga el elemento a extraer, se puede usar otro
formato como criterio de búsqueda. Los criterios de búsqueda
posibles buscan expresiones comunes (por ejemplo una búsqueda de
formato que busca un formato determinado, por ejemplo una serie de
caracteres, una secuencia de números, que posiblemente también
necesita un determinado número total de dígitos), o similares. Otro
criterio de búsqueda podría ser la búsqueda de un elemento simple
definido, llevando a cabo una comparación en serie de caracteres.
Por ejemplo se puede realizar una búsqueda de la palabra
"nacimiento", y cada elemento que cumpla ese criterio de
búsqueda se mostraría después como candidato.
Otro criterio de búsqueda posible podría ser
utilizar la denominada búsqueda de indicador, que significa que se
busca un elemento situado en una posición determinada
(izquierda/derecha/arriba/abajo) con respecto a un candidato
encontrado mediante otro criterio de búsqueda. Por ejemplo, si un
criterio de búsqueda consiste en buscar la palabra
"nacimiento", se podría llevar a cabo una búsqueda de indicador
para el elemento situado a la derecha del elemento
"nacimiento", y en este caso, el candidato resultante sería el
elemento situado a la derecha del elemento "nacimiento". En el
ejemplo de la figura 2, con tal búsqueda de indicador, el elemento
"5 de mayo de 1960" aparecería como candidato.
Otro criterio de búsqueda podría ser llevar a
cabo una búsqueda de todos los elementos que están presentes en una
base de datos.
La búsqueda de candidatos preferiblemente tolera
fallos en el sentido de que se pueden ignorar prefijos y sufijos,
para evitar errores típicos que se cometen al reconocer ópticamente
los caracteres, o para poder ignorar elementos tales como "." y
":". Por ejemplo, en el caso de la figura 2, se puede realizar
una búsqueda de la palabra "nacimiento" usando tal búsqueda
tolerante de fallos, por ejemplo usando un comodín. Después se
puede realizar una búsqueda del elemento "nacimiento", con lo
cual el elemento "nacimiento" aparecería como candidato.
Después se podría obtener de la búsqueda de indicador, el dato real
situado a la derecha del elemento "nacimiento" como
\hbox{candidato.}
Dependiendo del modo en el que se realice la
búsqueda de candidatos, se identificarán más o menos candidatos
para los elementos a extraer.
Otros métodos de búsqueda podrían incluir, por
ejemplo, una búsqueda trigrama, que quiere decir que se buscan
combinaciones de tres caracteres. Este es también un método para
realizar una búsqueda tolerante de fallos, ya que si, por ejemplo,
se produce un error de ortografía en un candidato, la búsqueda
trigrama podría obtener en cualquier caso tal candidato ya que se
reconocerían varias secuencias de caracteres que están contenidas
en el candidato como trigramas correctos. Otro método de búsqueda
tolerante de fallos consistiría en usar la distancia Levenshtein,
que es una representación del número de pulsaciones de tecla
necesarios en un teclado para cambiar una secuencia de caracteres
por otra. Con base en la distancia Levenshtein, también se podría
realizar una búsqueda tolerante de fallos.
La búsqueda de candidatos se realiza, de manera
preferible, buscando en el documento de trabajo elementos que
coincidan con el criterio de búsqueda usado. Por ello se puede
utilizar el análisis de elementos del documento que ya se ha
realizado. En principio, sin embargo, se puede llevar a cabo
también una búsqueda de candidatos directamente en el documento de
texto.
La búsqueda tiene como objetivo obtener elementos
candidatos que puedan contener la información que se busca. Queda
claro que, dependiendo de la información que se busque, se tiene
que adaptar el criterio de búsqueda. Si se busca un número de cuenta
bancaria, se usa preferiblemente un criterio de formato que haga
uso del formato de número posiblemente conocido del número de
cuenta. Por el contrario, si se busca el lugar de nacimiento, es
más conveniente buscar series de caracteres que números. Cualquiera
versado en la materia puede adaptar el criterio de búsqueda
(búsqueda de formato, búsqueda de palabra, búsqueda de base de
datos, búsqueda de indicador, etc., o una combinación de las
mismas) a la información particular que se busca dependiendo de las
circunstancias particulares.
Si los candidatos encontrados se van a utilizar
en un proceso de preparación para un aparato clasificador, como se
describe con más detalle después, es preferible que se indiquen o
muestren al usuario de algún modo y que el usuario pueda confirmar
si los candidatos encontrados coinciden o no con la información
buscada. De ese modo, el aparato clasificador puede prepararse como
se explica después. Los candidatos se pueden mostrar, por ejemplo,
destacándolos en el documento de texto buscado para que el usuario
los confirme o descarte apretando, por ejemplo, el ratón.
La búsqueda de formato o la búsqueda de elementos
tolerante de fallos proporciona candidatos para elementos que a
extraer. El resultado de la búsqueda de candidatos es ya bastante
buena en términos de corrección ya que se basa en las propiedades
inherentes de los elementos que se buscan, por ejemplo su formato o
su contenido informativo real. Los candidatos, sin embargo, se
pueden evaluar después con respecto a si pertenecen a una categoría
concreta o no, teniendo en cuenta también otros elementos que no
sean los candidatos, como se explica después.
A continuación se crea, para cada candidato, un
documento denominado documento de configuración de página que
contiene no sólo una representación del candidato y su posición en
el documento electrónico, sino también otros elementos que rodean
dicho elemento candidato y su posición correspondiente. Por tanto,
el documento de configuración de página es una representación
electrónica del candidato y su posición en el mismo documento
electrónico, así como de otros elementos que están en el documento
electrónico y su posición correspondiente. De manera preferida, un
documento de configuración de página para un candidato determinado
se genera para un área determinada que rodea dicho candidato. Esta
área (o una pluralidad de áreas correspondientes) se puede
predefinir o definir por el usuario.
Un ejemplo de definición de tal área circundante
hecha a través de la interfaz del usuario, se muestra en la figura
4. La figura 4 muestra cómo un usuario puede definir cuatro
recuadros en total que rodean dicho candidato. Un primer recuadro
rodea el candidato en todas direcciones, un segundo recuadro
representa los confines a la izquierda del candidato, un tercer
recuadro representa los confines a la derecha del candidato, y un
cuarto recuadro representa los confines encima del candidato. De
manera opcional, se puede utilizar también otro recuadro que
represente los confines que están debajo del candidato. El usuario
puede medir el tamaño de los recuadros, por ejemplo introduciendo
valores que representen su tamaño en puntos por pulgada o cualquier
otra unidad como por ejemplo píxeles, mm, o similares. En el ejemplo
de la figura 4, el usuario puede medir el tamaño de los recuadros,
sin embargo, estos recuadros también se puede predefinir. El usuario
puede definir un área para producir el documento de configuración de
página dependiendo de la categoría específica del elemento que desee
extraer.
Para producir el documento de configuración de
página, se tienen en cuenta todos los elementos que, teniendo en
cuenta su posición en el documento electrónico, se encuentran
dentro de los recuadros que definen el área del documento de
configuración de página para producir el documento de configuración
de página. Para este propósito, se puede hacer referencia al
documento de trabajo en el que están almacenados todos los
elementos junto con sus posiciones correspondientes.
A continuación, supongamos que el proceso para
obtener elementos candidatos vuelve al elemento 5 de mayo de 1960
del documento de la figura 2 como candidato. Este puede ser, por
ejemplo, el resultado de una búsqueda de formato que busca una
combinación de tres elementos individuales en serie, y donde los
tres elementos deben contener dos números enteros (que representan
el día y el año) y otro número o palabra que represente el mes. El
resultado de la búsqueda podría ser la serie de los tres elementos.
Se puede imaginar también otro criterio de búsqueda que nos lleve
al 6 de mayo de 1960 como candidato, dando como resultado tal
búsqueda de indicador que busca tres elementos cerca del elemento
"nacimiento", el 6 de mayo de 1960 transferido como candidato.
Cualquier otra búsqueda de expresiones comunes podría dar también
como resultado un candidato como el 6 de mayo de 1960, por ejemplo
la búsqueda de una expresión común que contenga tres elementos,
siempre que dos de los tres elementos sean números y el tercer
elemento sea una palabra o un número, y donde uno de los números
esté dentro de un margen que oscile entre 1 y 31. Queda claro para
cualquier persona versada en la materia que son posibles muchas
definiciones de criterios de búsqueda que nos lleven a candidatos de
una información que sea una "fecha".
Después de obtenidos uno o más candidatos
mediante un proceso de búsqueda como el que se ha explicado antes,
se crea para cada uno de los candidatos un documento de
configuración de página que es una representación del candidato y de
su área circundante. Para crear el documento de configuración de
página, se identifican primero los elementos que están dentro del
área que se va a usar para la generación del documento de
configuración de página, y después, en base a estos elementos, se
crea el documento de configuración de página. Este contiene una
representación del candidato y los elementos que están dentro de
esta área junto con la posición correspondiente de estos
elementos.
La figura 5a muestra un ejemplo de un área
designada en el caso del documento de texto de la figura 2. El
candidato aquí es "5 de mayo de 1960", y la línea de puntos de
la figura 5a define el área designada que rodea al candidato. Todos
los elementos del documento de la figura 2, respectivamente los de
la figura 5a que están dentro de esta área, se usan para producir
el documento de configuración de página. El área mostrada en la
figura 5a puede ser el resultado de una definición del usuario que
utiliza una interfaz como la de la figura 4 o puede también
predefinirse.
En la figura 5b, se muestra un ejemplo de
documento de configuración de página generado para el candidato
"5 de mayo de 1960" y el área correspondiente designada como
se muestra en el ejemplo de la figura 5a. El primer renglón del
documento de configuración de página corresponde al mismo elemento
"5 de mayo de 1960". Este está representado en el documento de
configuración de página mediante la secuencia de caracteres
"DDMMYY", ya que según la aplicación particular de la presente
realización, se reconoce que su formato corresponde a una
"fecha". Sin embargo ello no es necesario, sino sólo una
opción preferible cuando se genera el documento de configuración de
página, que se sustituya un elemento reconocible cuyo formato se
pueda reconocer en el documento de configuración de página por una
representación correspondiente de dicho formato, como aquí mediante
DDMMYY como una representación del formato "fecha". La
secuencia de caracteres que está a la derecha de la secuencia
"DDMMYY" representa la posición de este elemento en el
documento electrónico, como se explica después con más detalle.
El primer renglón del documento de configuración
de página que se muestra en la figura 5b corresponde por tanto al
elemento candidato "5 de mayo de 1960". La posición del
candidato en el documento electrónico que se muestra en la figura 2
y también su tamaño se representa mediante la secuencia de
caracteres "MXMYWLHM", como queda más claro en la siguiente
explicación.
Para explicar con más detalle cómo se representa
la posición del elemento candidato que está en el documento
electrónico en el documento de configuración de página mediante la
secuencia de caracteres "MXMYWLHM", hay que hacer referencia a
la figura 6. La figura 6 muestra un recuadro denominado recuadro del
candidato que quiere decir el rectángulo limítrofe del elemento
candidato. Dependiendo del tamaño del elemento candidato (por
ejemplo, dependiendo de la familia de caracteres) también varía el
tamaño del recuadro del candidato y puede representarse en el
documento de configuración de página utilizando el código para el
tamaño de recuadro que se ilustra esquemáticamente en la parte
derecha de la figura 6. Basándose en este código, el tamaño del
recuadro se codifica como "WLHM" que quiere decir que el
recuadro del candidato tiene una "gran anchura" (WL) y una
"altura media" (HM), como podemos ver en la figura 6. Esta
secuencia de programación nos lleva a los cuatro últimos caracteres
WLHM del primer renglón del documento de configuración de página de
la figura 5b. Se puede entender fácilmente que los valores reales se
representan mediante secuencias de programación, en otras palabras,
los valores se codifican como "pequeños" y "grandes"
dependiendo de la aplicación particular y son una mera cuestión de
elección por parte de la persona versada en la
\hbox{materia.}
Por tanto, como se puede ver en el primer renglón
del documento de configuración de página que se muestra en la
figura 5b, no sólo se codifica la posición del recuadro del
candidato (que representa la posición del mismo candidato) en el
documento, como se explica después, sino también el tamaño del
recuadro del candidato (que representa el tamaño del candidato). La
representación del tamaño del recuadro del candidato mediante una
secuencia de programación correspondiente se ilustra
esquemáticamente en la parte inferior del lado derecho de la figura
6. Un recuadro de candidato que tenga un candidato pequeño en una
dirección "x" se codifica como "WS" (para una "anchura
pequeña"), un recuadro de candidato que tenga un tamaño medio se
codifica como "WM" (para una "anchura media"), y un
recuadro de candidato que tenga un tamaño grande en la dirección
"x" se codifica como "WL" (para una "anchura
grande"), y un recuadro de candidato que tenga un tamaño extra
grande en la dirección "x" se codifica como "WX" (para una
"anchura extra grande"). De manera parecida, se van a asignar
valores a las secuencias de programación como mera cuestión de
elección por parte de la persona versada en la materia.
De manera parecida a la anchura, también se
codifica la altura del recuadro del candidato mediante una de las
secuencias "HS", "HN", "HL", o mediante "HS".
Para el presente caso de la figura 5b con el candidato 5 de mayo de
1960, el recuadro del candidato se codifica como "WLHM", que
quiere decir que tiene una gran extensión en la dirección "x" y
un tamaño medio en la dirección "y".
La posición del recuadro del candidato en las
direcciones "x" e "y" se codifica como se ilustra
esquemáticamente en la parte izquierda de la figura 6. Para este
propósito, a ciertas áreas del documento que se muestra en la figura
2 se les asignan secuencias de programación como las que se muestran
en la parte izquierda de la figura 6. Dependiendo del área en la
que se coloque el recuadro del candidato, las posiciones "x" e
"y" del recuadro del candidato se codifican como "LL",
"MX", "RR" (para la posición "x"), y como "TT",
"MY" o "BB" (para la posición "y").
En el presente caso de la figura 5a para el
candidato 5 de mayo de 1960, el recuadro del candidato con respecto
a su emplazamiento en la dirección "x" es medio, lo que quiere
decir que no está ni muy lejos de la parte derecha del documento ni
muy lejos de la parte izquierda del documento, sino más bien en el
centro del documento con respecto a su posición "x". Tal
emplazamiento se codifica mediante la secuencia de caracteres
"MX", como puede verse en la parte izquierda de la figura 6. La
posición "y" del recuadro del candidato se codifica mediante
la secuencia "MY", ya que con respecto a su posición "y",
está relativamente en el centro de dicho documento. De aquí se puede
deducir el código de posición "MXMY" que se muestra en el
primer renglón del documento de configuración de página, a partir
del recuadro del candidato. La combinación de la representación del
formato del candidato, la posición del recuadro del candidato y el
tamaño del recuadro del candidato da como resultado la secuencia de
caracteres que se muestra en el primer renglón de la figura 5b.
Se debe entender que la codificación que se
muestra en la figura 6 para el recuadro del candidato es sólo un
ejemplo, y que se pueden usar también otros códigos, otras
distribuciones entre posición y código y otras divisiones del
documento en áreas correspondientes. La granularidad del tamaño y la
posición del recuadro del candidato puede ser más fina o más gruesa
que en la figura 6 dependiendo de la aplicación particular, como
puede reconocer fácilmente cualquier persona cualificada.
De manera similar, las secuencias de programación
que se han utilizado aquí son sólo arbitrarias. Aquí, "LL"
significa "absolutamente en la izquierda", "MX"
significa "justo en el medio en la dirección "x", y "RR"
significa "absolutamente en la derecha del documento (en la
posición "x"). De manera parecida, "TT" significa
"absolutamente en la parte superior", "MY" significa
"justo en el medio", y "BB" significa "absolutamente en
la parte inferior del documento con respecto a la dirección y".
Sin embargo, se pueden usar también otras secuencias de
programación siempre que puedan ser reconocidas por una persona
cualificada. Además, en vez de DDMMYY se pueden utilizar otras
secuencias de caracteres para representar el formato reconocido de
una "fecha".
Después de haber codificado el recuadro del
candidato como se ha explicado antes, los otros elementos que están
dentro del área del documento de configuración de página que se ha
explicado con respecto a la figura 5a también se codifican e
incorporan en el documento de configuración de página.
El documento de configuración de página que se
muestra en la figura 5b se ha creado tomando como base un área que
se muestra en la figura 5a mediante la línea de puntos. Como ya se
ha explicado antes, el área circundante se puede fijar de manera
diferente en un área más pequeña, dependiendo de las preferencias
del usuario y de la carga de trabajo de cálculo que puede procesar
el ordenador en uso, y, naturalmente, se puede fijar en un área más
grande. Por tanto, se entiende que los diseños que se utilizan aquí
son solamente ejemplos, y que se pueden utilizar también otras
definiciones de áreas. Naturalmente, cuanto mayor sea el área
usada, más información se puede incluir en el documento de
configuración de página creado a partir de esta área y por tanto, es
posible que con un área aumentada aumente a su vez la precisión de
la evaluación del documento de configuración de página. Sin
embargo, esto depende de la aplicación particular y del propósito
particular, y con áreas designadas pequeñas, también se pueden
conseguir buenos resultados.
El segundo renglón del documento de configuración
de página de la figura 5b es una representación del número de fax
que se muestra en la figura 5a y está dentro del área designada.
Como según la aplicación particular de la presente realización se
reconoce que los dos elementos 07029 y 8125, que están dentro del
área designada, son números enteros, éstos se representan en el
documento de configuración de página mediante una secuencia de
programación asignada a la representación del números enteros, es
decir IIQQ.
Los renglones segundo y tercero del documento de
configuración de página que se muestra en la figura 5b, representan
el código de área 07029 y el número 8125, respectivamente. La
secuencia de programación IIQQ que representa un número entero viene
seguida después por una secuencia de programación del número entero
en el documento de texto de la figura 2 con respecto al elemento
candidato.
Para codificar la posición correspondiente, se
puede utilizar cualquier código. El código particular que se
utiliza aquí se ilustra esquemáticamente en la figura 7. Para
codificar gamas de distancias discretas correspondientes a las
posiciones relativas en las direcciones "x" e "y", se
asignan secuencias de programación correspondientes, por ejemplo,
"NR" para cerca, "FF" para lejos, "HEE" para una
posición igual en dirección horizontal, "VFF" para una
posición igual en dirección vertical, y así sucesivamente. El código
particular se ilustra en la figura 7 aunque se entiende que es
simplemente un ejemplo y se puede modificar muy fácilmente. Por
ejemplo, las secuencias de programación pueden ser diferentes, la
separación en rangos discretos puede ser diferente, el número de
rangos, y así sucesivamente.
En la figura 7, en relación con la figura 5b, se
debe entender que el segundo renglón del documento de configuración
de página de la figura 5b se basa en el hecho de que el código de
área 07029 está cerca hacia la izquierda (LNR) y cerca por encima
(ANR) del recuadro del candidato, lo que nos deriva a una secuencia
de programación de posición LNRANR como la que se muestra en el
segundo renglón de la figura 5b unida al código de números enteros
IIQQ.
Como el número 8125 es horizontalmente igual
aunque está cerca del candidato, por encima del mismo, esto nos
conduce al tercer renglón de la figura 5b que se lee IIQQHEEANR.
Los tres elementos restantes "fecha",
"de" y "nacimiento" que están dentro del área designada,
se representan en los tres últimos renglones del documento de
configuración de página de la figura 5b junto con sus secuencias de
programación de posición correspondientes que se entienden
fácilmente en conexión con la figura 7. Todos los elementos son
verticalmente iguales al candidato (VEE) aunque a distancias
horizontalmente diferentes del candidato.
Queda claro que en vez del código de posición
relativa, también se pueden usar posiciones absolutas de los
elementos que están dentro del área designada para producir el
documento de configuración de página.
Además, cuando se genera el documento de
configuración de página, también es posible codificar otros
elementos similares de los cuales se puede reconocer el formato, no
sólo, por ejemplo, cuando el elemento tiene el formato de una
"fecha", en el documento de configuración de página mediante
una secuencia de programación correspondiente. Aunque aquí sólo se
muestra la fecha en el primer renglón y los números enteros en los
renglones segundo y tercero del documento de configuración de
página, se pueden sustituir también por otros elementos que se
puedan reconocer, por ejemplo códigos postales (que se pueden
reconocer consultando una base de datos) y que se pueden representar
mediante una secuencia de caracteres determinada tal como ZZZ, o
similar. El reconocimiento correspondiente se puede basar en un
reconocimiento de formato o en la consulta de una base de datos
(donde por ejemplo están almacenados los códigos
\hbox{postales).}
Como se ha explicado antes, se genera un
documento de configuración de página que contiene información del
mismo candidato, su posición en el documento y además información de
otros elementos del documento y su posición en el documento. En el
presente ejemplo, la información referente a la posición se
representa sustituyendo valores de las coordenadas por secuencias
de caracteres que representan una posición según un código
determinado que se usa para definir los emplazamientos o áreas en
los que se divide el documento electrónico para fines de
codificación y a los que se les han asignado códigos de caracteres
correspondientes. De manera similar, se pueden utilizar códigos
numéricos para codificar también las posiciones de los elementos de
dicho documento electrónico. Se puede usar cualquier código que
represente la posición y/o el formato de los elementos para
producir el documento de configuración de página.
El documento de configuración de página también
contiene información adicional de elementos no textuales del
documento a analizar, por ejemplo renglones o cuadrículas que están
en el documento. Esta información se puede obtener fácilmente
mediante un análisis geométrico del documento, y después los
renglones o cuadrículas presentes en un documento se pueden
codificar en el documento de configuración de página mediante
secuencias de programación correspondientes, preferiblemente también
representando su posición correspondiente, posiblemente también su
estilo y más información.
De manera preferible, el código usado para
producir el documento de configuración de página contiene una
codificación de posición basada en la asignación de áreas discretas
de emplazamiento correspondientes a códigos de posición como los que
se han explicado antes. Más preferiblemente aún, en el documento de
configuración de página se representa también información del
estilo o el formato que se puede reconocer como el formato o estilo
de elementos mediante secuencias de programación correspondientes.
Sin embargo, para producir un documento de configuración de página,
es posible utilizar solamente algunos de estos elementos de un
código.
La posición que se indica en el documento de
configuración de página puede ser una representación de la posición
geométrica basada en los valores de las coordenadas, por ejemplo
los valores de las coordenadas "x" e "y" que se han
explicado antes. Sin embargo, también es posible que la información
de la posición de un elemento que está en el documento de
configuración de página represente la posición relativa entre el
candidato y este elemento, por ejemplo el número de elementos que
aparecen entre este elemento y el candidato. Por tanto, también es
posible codificar la posición relativa entre el candidato y otros
elementos que están en el área designada mediante la distancia entre
los mismos a través del número de palabras que aparecen entre
ellos. Tal código puede ser útil, por ejemplo si el documento de
texto a procesar en realidad no tiene mucho diseño propio, por
ejemplo un correo electrónico. Sin embargo, como alternativa, para
un correo electrónico se podría utilizar y calcular un diseño
virtual para el procesamiento posterior en vez de la posición
relativa de los elementos como se ha explicado antes.
Cuanta más información esté presente en el
documento de configuración de página del candidato y sus elementos
circundantes, más precisos serán el documento de configuración de
página y el resultado del procesamiento posterior. Sin embargo,
cuanto más sofisticado sea el documento de configuración de página,
más potencia de proceso se necesitará para crear el documento de
configuración de página y para procesarlo después para tomar la
decisión. Por tanto, dependiendo de la precisión deseada del proceso
de decisión, el usuario o programador puede elegir el área para
producir el documento de configuración de página así como la
información a utilizar cuando se genere el documento de
configuración de página.
Hasta aquí se ha explicado la obtención de
candidatos y la generación posterior de un documento de
configuración de página para un candidato. Si ahora se desea, por
ejemplo, extraer una información, por ejemplo la fecha de nacimiento
del documento de la figura 2, se lleva a cabo una búsqueda de
candidatos en el documento para obtener candidatos para una fecha.
En el caso de la figura 2, una búsqueda de expresión normal o de
formato como se ha explicado antes elegiría dos candidatos que,
dependiendo del criterio de búsqueda usado, podrían ser con la
fecha de nacimiento del 5 de mayo de 1960 y el 17 de mayo de 1979.
Para ambos candidatos, se genera después un documento de
configuración de página como el que se ha explicado antes y este
documento de configuración de página se introduce en un aparato
clasificador preparado para reconocer los documentos de
configuración de página que se han generado a partir de datos
referentes al nacimiento a diferencia de los documentos de
configuración de página que se han generado a partir de datos que,
sin embargo, no son fechas de nacimiento.
Tal reconocimiento es posible ya que el documento
de configuración de página que se ha generado a partir de una fecha
de nacimiento contiene más indicaciones que permiten reconocerlos
como documentos de configuración de página a partir de fechas de
nacimiento en vez de otras fechas. Por ejemplo, es frecuente el caso
en el que aparece la palabra "nacimiento" en los confines de
la fecha de nacimiento, y si tenemos un documento en el que se
incluye este término, hay otra indicación de que este es el
documento de configuración de página que se ha generado a partir de
una fecha de nacimiento. De manera similar, otros elementos que
aparecen en los confines de la fecha de nacimiento pueden
interpretarse también como una indicación, por ejemplo el término
"lugar" o el término "de" como es el caso del ejemplo de
la figura 5b. Sin embargo, si por ejemplo hay varias fechas de
nacimiento en una columna de una tabla, conteniendo la parte
superior de la columna el término "nacimiento", si se codifica
la posición del término "nacimiento" como se ha explicado
antes, éste se puede utilizar mediante un aparato clasificador como
una indicación de que las fechas de esta columna son en realidad
fechas de nacimiento. En general, el área circundante o los
confines de un candidato para el que se genera un documento de
configuración de página se puede utilizar como indicación para el
contenido informativo real de tal candidato mediante un aparato
clasificador. Teniendo en cuenta las indicaciones dadas por tal
área circundante o cercana, se puede evaluar un conjunto de
candidatos extraídos de un documento según cualquier criterio de
búsqueda y si estos candidatos contienen en realidad la información
que se busca.
Naturalmente, el documento de configuración de
página se puede producir también directamente para todos los
elementos de un documento de texto y después se puede evaluar cada
elemento en base al documento de configuración de página que se ha
generado de este modo, por ejemplo si éste pertenece a una cierta
categoría o no. Sin embargo, si se usa una búsqueda de candidatos,
primeramente se reducen los costes de cálculo que se producirían si
se tuviera que producir un documento de texto para cada elemento
del documento de texto.
A continuación se explica con más detalle el
proceso de extracción y el proceso de preparación.
Una vez generado el documento de configuración de
página, éste se puede usar para preparar una red neural o cualquier
otro sistema informatizado que pueda decidir si un documento
determinado pertenece o no a una categoría o clase determinada. Para
este propósito, los documentos de configuración de página de los
candidatos se introducen en la red neural o en cualquier otro
aparato de decisión (aparato clasificador) junto con la información
de si el documento de configuración de página corresponde o no a un
candidato correcto, que quiere decir si el candidato tiene o no el
contenido informativo deseado.
En la figura 8 se muestra esquemáticamente la
preparación de tal red neural.
Un documento electrónico se analiza como se ha
explicado antes para obtener elementos de un documento de texto y
sus posiciones correspondientes. Después, preferiblemente se crea
a partir de los mismos un documento basado en el texto, y un
documento de trabajo. A continuación se realiza un filtrado para
obtener a partir de los mismos un conjunto de candidatos que estén
dentro de la categoría deseada. De manera preferible, el usuario
corrige el conjunto obtenido manual o automáticamente, por ejemplo
comprobando si un candidato obtenido se puede corregir más allá de
un valor de umbral determinado. Para una corrección manual en la
fase de preparación, los candidatos se tienen que destacar en el
documento y el usuario puede confirmar después si alguno de ellos o
todos ellos son correctos o no. La mencionada selección manual o
automática de corrección de resultados deriva después en un
conjunto de resultados correctos y en un conjunto de resultados
incorrectos. Los documentos de configuración de página se generan
para cada uno de los elementos del conjunto de resultados correctos
y para cada uno de los elementos del conjunto de resultados
incorrectos. Los documentos de configuración de página generados
para el conjunto de resultados incorrectos y los documentos de
configuración de página para el conjunto de resultados correctos se
utilizan después para preparar la red neural. Si no se reconoce
ningún candidato en absoluto, el usuario puede elegir por si mismo
un candidato, destacarlo (por ejemplo con el ratón) y usarlo como
entrada de preparación.
En la figura 9 se muestra un proceso de
extracción usando una red que se ha preparado como se muestra en la
figura 8. Un conjunto de candidatos se obtiene de manera similar a
la figura 8 y se genera un documento de configuración de página para
cada uno de los mismos como se ha explicado antes. Los documentos
de configuración de página se utilizan después como entradas para
la red neural preparada, que decide después si los candidatos
pertenecen a la categoría deseada o no.
Una salida de la red puede consistir en los
candidatos extraídos correctamente, o por ejemplo también en una
consecuencia que sopesa la probabilidad de corrección de cada
candidato. Los candidatos extraídos se pueden importar de o exportar
directamente a otro documento electrónico, por ejemplo a una base
de datos, un archivo MS-Excel, una tabla, un
documento de Word o cualquier otro documento adecuado para un
posterior procesamiento electrónico o similar.
El proceso de extracción que incluye la
identificación de candidatos y la generación del documento de
configuración de página se puede realizar como se ha explicado en
detalle antes. El documento de configuración de página generado
correspondiente se introduce, para todos los candidatos encontrados,
en un aparato clasificador o de decisión que no tiene porque ser,
pero es preferiblemente una red neural, y después se toma la
decisión de si cada uno de los candidatos pertenece a la categoría
correcta o no.
En la solicitud de patente europea 99108354.4 se
describe un aparato particularmente adecuado para clasificar los
documentos de configuración de página generados, ya pertenezcan a la
categoría deseada o no, cuyo contenido completo se incorpora aquí
como referencia. El aparato que se describe en ella puede clasificar
documentos de texto representando los mismos como vectores, donde
los valores de los componentes de los vectores corresponden a la
frecuencia con la que se produce una determinada palabra o término
en el documento. Tal vector que representa un documento se extiende
sobre un espacio vectorial dimensional n, y varios documentos juntos
también se extienden sobre un espacio vectorial determinado. La
clasificación se realiza calculando un hiperplano que separa un
espacio vectorial en al menos dos subespacios. Por tanto se puede
realizar una clasificación en tantas clases como subespacios están
presentes. Un proceso de preparación o aprendizaje consiste en
establecer el espacio vectorial y el hiperplano de separación para
un conjunto de documentos de aprendizaje, y después se puede
clasificar un documento desconocido calculando si el vector
correspondiente está dentro de un subespacio o en otro. Como con el
método descrito antes en detalle es posible representar elementos de
un documento de texto a través de un documento de configuración de
página que ofrece indicaciones de sus áreas circundantes, y como el
propio documento de configuración de página es de nuevo un
documento de texto, se puede usar el aparato clasificador que se
describe en la mencionada solicitud de patente europea para fines
clasificatorios. Una aplicación preferida del aparato clasificador
que se describe en la solicitud de patente descrita consiste en una
red neural, por ejemplo en un Perceptrón. Otros detalles, como por
ejemplo cómo se puede aplicar el aparato de decisión se pueden ver
en esta solicitud y por tanto no se van a explicar aquí con más
detalle.
Sin embargo, se debe entender que se puede
utilizar cualquier otra red neural o cualquier otro método o aparato
informático que pueda evaluar (clasificar) documentos teniendo en
cuenta si éstos pertenecen a una categoría determinada o no para
preparar documentos de configuración de página y después para tomar
la decisión de si un candidato (o su documento de configuración de
página correspondiente) tiene que considerarse como correctamente
extraído o no. También debe entenderse que se puede utilizar
cualquier otra presentación de documento de configuración de página
en relación con la presente invención, no solamente los documentos
en los que las posiciones se representan mediante secuencias de
caracteres. También es perfectamente posible, por ejemplo, codificar
las posiciones mediante números absolutos que representen las
posiciones (coordenadas) o mediante ángulos y distancias
(coordenadas polares).
Cualquier persona versada en la materia debe
entender que la descripción detallada anterior sólo ilustra una
realización ejemplar de la presente invención, y que otras
realizaciones quedan perfectamente al alcance de los conocimientos
generales de la persona cualificada. También debe quedar claro para
aquellas personas versadas en la materia que el método de la
presente invención puede aplicarse mediante cualquier sistema
informático, mediante cualquier ordenador de características
generales o mediante cualquier otro hardware especializado que
lleve a cabo el método que se ha explicado antes. Por tanto, un
aparato según la presente invención puede consistir en cualquier
sistema informático que realice el método de la presente invención,
mientras que el aparato consista, por ejemplo, en un sistema
informático como el que se muestra en la figura 1. En la medida en
que ciertos elementos de aparato o componentes de aparato se
mencionan aquí o en las reivindicaciones anexas, pueden
implementarse mediante un ordenador o parte de un ordenador que
incluya o ejecute programas o partes de programas informáticos.
Siempre que la presente invención se refiera a un programa
informático o a un producto de un programa informático, debe quedar
claro para cualquiera versado en la materia que cualquier soporte
de datos o cualquier elemento informático tal como la memoria, una
línea de transmisión, o similar que pueda incluir instrucciones de
programa informático, puede constituir una realización de la
presente invención siempre que puedan incluir instrucciones de
programa informático que permitan a un ordenador ejecutar un método
según la presente invención. La persona versada en la materia
reconocerá que se pueden escribir muchos programas informáticos que
trabajen según los principios que se han explicado aquí, por lo
cual cualquier programa informático que trabaje según el método de
la invención que se ha descrito debe considerarse como dentro del
objeto de la presente invención.
Además, una estructura de datos que represente la
estructura de un documento de configuración de página como el que se
ha descrito, puede ser también una realización de la presente
invención, independientemente de si está incorporada o incluida en
un medio de almacenamiento, un soporte de datos, una línea de
transmisión, una memoria tal como un ROM, RAM o similar.
Además, la presente invención puede usarse en una
arquitectura de cliente-servidor, lo que significa
que partes de un programa de ordenador que implementen la presente
invención pueden ejecutarse en un servidor y otras partes pueden
ejecutarse en un
\hbox{cliente.}
En la medida en que en la descripción anterior o
en las reivindicaciones adjuntas se mencionen componentes de
aparato, pueden ser realizados por un ordenador que desarrolle un
programa de ordenador o ciertas instrucciones de programa, o pueden
ser implementados por cualquier hardware especializado que
desarrolle la función de tal componente, tal como un circuito
electrónico, un ordenador de utilidad especial, o similar.
Para aquellos versados en la materia queda claro
que se pueden realizar otras modificaciones y aplicaciones, y se
debe entender que la presente solicitud se ha explicado mediante
realizaciones ejemplares que no limitan el objeto de la presente
invención.
En particular, se debe entender que el ejemplo de
extraer una fecha de nacimiento no es más que un ejemplo, y el
método que se ha explicado antes se puede utilizar para extraer
cualquier elemento informativo que pertenezca a una categoría
determinada de un documento de texto, como queda claro para el
lector cualificado.
Claims (24)
1. Método implementado por ordenador para generar
una entrada a utilizar por un aparato clasificador basada en un
documento electrónico que comprende una pluralidad de elementos,
caracterizado porque consiste en:
analizar dicho documento electrónico para obtener
uno o más de dichos elementos junto con información de su posición
correspondiente en dicho documento;
producir un documento electrónico de
configuración de página para usarlo como dicha entrada en dicho
aparato clasificador, comprendiendo dicho documento de configuración
de página:
una representación de una pluralidad de dichos
elementos obtenidos en dicha fase de análisis junto con información
que representa su posición absoluta y/o relativa en dicho documento
electrónico.
2. Método según la reivindicación 1, en donde
dicho documento de configuración de página comprende:
una representación de un primer elemento de dicha
pluralidad de elementos de dicho documento de texto junto con
información que representa su posición absoluta y/o relativa en
dicho documento electrónico, y
una representación de otros elementos de dicha
pluralidad de elementos de dicho documento de texto junto con
información que representa su posición absoluta y/o relativa en
dicho documento electrónico, quedando situados los otros elementos
mencionados dentro de un área predefinida o definida por el usuario
que circunda y/o rodea dicho primer elemento.
3. Método según la reivindicación 1 ó 2 que
comprende además:
buscar elementos que cumplan un criterio de
búsqueda determinado para obtener elementos candidatos que, en lo
que concierne a su contenido informativo, estén dentro de una cierta
categoría, y
producir un documento de configuración de página
para uno o más de dichos elementos candidatos.
4. Método según la reivindicación 3, en donde
dicha fase de búsqueda de candidatos comprende además una o más de
las siguientes etapas:
buscar elementos en dicho documento que
correspondan a un cierto criterio de formato;
buscar palabras en dicho documento que
correspondan a un cierto criterio de comparación en serie de
caracteres;
realizar una búsqueda de palabras tolerante de
fallos;
realizar una búsqueda de un elemento que tenga
una posición relativa predefinida con respecto a un candidato
encontrado;
realizar una búsqueda de una base de datos para
buscar elementos que correspondan a palabras almacenadas en la base
de datos.
5. Método según una de las reivindicaciones 1 a
4, que comprende además una o más de las siguientes etapas:
representar la posición de un elemento en dicho
documento de configuración de página mediante una secuencia de
caracteres correspondiente basada en un código de posición
predefinido;
representar elementos que tengan un formato
predefinido reconocible mediante una secuencia de caracteres basada
en un código de formato predefinido;
representar elementos que tengan un significado
reconocible mediante una secuencia de caracteres basada en un código
de significación predefinido.
6. Método según la reivindicación 5, en donde
dicho formato reconocido comprende uno o más:
renglones verticales y/u horizontales en dicho
documento;
números con coma flotante;
fechas;
números enteros;
códigos postales.
7. Método según cualquiera de las
reivindicaciones anteriores, en donde el área tenida en cuenta para
producir dicho documento de configuración de página comprende una o
más áreas geométricas cuyas dimensiones puede predefinir o fijar el
usuario.
8. Método según cualquiera de las
reivindicaciones 1 a 7, que comprende además:
utilizar dicho documento electrónico de
configuración de página como una entrada para un aparato
clasificador, para preparar dicho aparato clasificador o para
evaluar dicha entrada mediante dicho aparato clasificador.
9. Método para extraer de un documento
electrónico uno o más elementos que pertenecen a una categoría
determinada, caracterizado porque comprende:
buscar elementos candidatos en dicho documento
en base a uno o más criterios de búsqueda predefinidos;
para cada elemento candidato obtenido en dicha
fase de búsqueda, producir un documento de configuración de página
según cualquiera de las reivindicaciones anteriores; y
determinar si dicho candidato pertenece a dicha
categoría en base al contenido informativo de dicho documento de
configuración de página.
10. Método de preparación de un aparato
clasificador para que aprenda a reconocer si un elemento de un
documento pertenece a una cierta categoría o no,
caracterizado porque comprende:
buscar elementos candidatos en dicho documento en
base a uno o más criterios de búsqueda predefinidos;
para cada elemento candidato obtenido en dicha
fase de búsqueda, producir un documento de configuración de página
según cualquiera de las reivindicaciones anteriores; e
introducir dicha configuración de página junto
con la información para saber si dicho candidato pertenece o no a la
categoría en cuestión en el aparato clasificador para preparar dicho
aparato clasificador.
11. Método según la reivindicación 9 ó 10, en
donde dicho aparato clasificador es una red neural.
12. Aparato para producir una entrada a utilizar
por un aparato clasificador basada en un documento electrónico que
comprende una pluralidad de elementos, caracterizado porque
comprende:
un analizador que analiza dicho documento
electrónico para obtener uno o más de dichos elementos junto con
información de su posición correspondiente en dicho documento;
un generador que produce un documento electrónico
de configuración de página para ser usado cuando entre en dicho
aparato clasificador, comprendiendo dicho documento de configuración
de página:
una representación de una pluralidad de dichos
elementos obtenidos en dicha fase de análisis con información que
representa su posición absoluta y/o relativa en dicho documento
electrónico.
13. Aparato según la reivindicación 12, en donde
dicho documento de preparación de página comprende:
una representación de un primer elemento de dicha
pluralidad de elementos de dicho documento de texto junto con
información que representa su posición absoluta y/o relativa en
dicho documento electrónico, y
una representación de otros elementos de dicha
pluralidad de elementos de dicho documento de texto junto con
información que representa su posición absoluta y/o relativa en
dicho documento electrónico, quedando situados los otros elementos
mencionados dentro de un área predefinida o definida por el usuario
que circunda y/o rodea dicho primer elemento.
14. Aparato según la reivindicación 12 ó 13 que
comprende además:
un buscador para buscar elementos que satisfagan
un criterio de búsqueda determinado para obtener elementos
candidatos que, en lo que concierne a su contenido informativo,
estén dentro de una cierta categoría, y
produciendo dicho generador un documento de
configuración de página para uno o más de dichos elementos
candidatos.
15. Aparato según la reivindicación 14, en donde
dicho buscador para buscar candidatos comprende además uno o más de
los siguientes buscadores:
un buscador de elementos para buscar elementos en
dicho documento que correspondan a un cierto criterio de
formato;
un buscador de palabras para buscar palabras en
dicho documento que correspondan a un cierto criterio de comparación
en serie de caracteres;
un buscador de palabras que ejecute una búsqueda
de palabras tolerante de fallos;
un buscador de elementos que ejecute una búsqueda
de un elemento que tenga una posición relativa predefinida con
respecto a un candidato encontrado;
un buscador de bases de datos que efectúe una
búsqueda de bases de datos para buscar elementos que correspondan a
palabras almacenadas en la base de datos.
16. Aparato según una de las reivindicaciones 12
a 15, en donde dicho generador de configuración de página está
también adaptado para efectuar una de las siguientes tareas cuando
produce dicho documento de configuración de página:
representar la posición de un elemento en dicho
documento de configuración de página mediante una secuencia de
caracteres correspondiente basada en un código de posición
predefinido;
representar elementos que tengan un formato
predefinido reconocible mediante una secuencia de caracteres basada
en un código de formato predefinido;
representar elementos que tengan un significado
reconocible mediante una secuencia de caracteres basada en un código
de significación predefinido.
17. Aparato según la reivindicación 16, en donde
dicho formato reconocible comprende uno o más:
renglones verticales y/u horizontales en dicho
documento;
números con coma flotante;
fechas;
números enteros;
códigos postales.
18. Aparato según cualquiera de las
reivindicaciones 12 a 17, en donde el área tenida en cuenta para
producir dicho documento de configuración de página comprende una o
más áreas geométricas cuyas dimensiones puede predefinir o fijar el
usuario.
19. Aparato según cualquiera de las
reivindicaciones 12 a 18, que comprende además:
dicho aparato clasificador que utiliza dicho
documento electrónico de configuración de página como una entrada,
para preparar dicho aparato clasificador o para evaluar dicha
entrada mediante dicho aparato clasificador.
20. Aparato para extraer de un documento
electrónico uno o más elementos que pertenecen a una categoría
determinada, caracterizado porque comprende:
un buscador que busca elementos candidatos en
dicho documento en base a uno o más criterios de búsqueda
predefinidos;
un generador para cada elemento candidato
obtenido en dicha fase de búsqueda, produciendo un documento de
configuración de página según cualquiera de las reivindicaciones
anteriores; y
un dispositivo de determinación para determinar
si dicho candidato pertenece a dicha categoría en base al contenido
informativo de dicho documento de configuración de página.
21. Aparato clasificador que se puede preparar
para reconocer si un elemento de un documento pertenece o no a una
cierta categoría, caracterizado porque comprende:
un buscador para buscar elementos candidatos en
dicho documento en base a uno o más criterios de búsqueda
predefinidos;
un generador para producir, para cada elemento
candidato obtenido en dicha fase de búsqueda, un documento de
configuración de página según cualquiera de las reivindicaciones
anteriores; y
medios para introducir dicha configuración de
página junto con la información para saber si dicho candidato
pertenece o no a la categoría en cuestión en el aparato clasificador
para preparar dicho aparato clasificador.
22. Aparato según la reivindicación 20 ó 21, en
donde
dicho aparato clasificador es una red neural.
23. Programa informático que comprende un código
de programa que puede ejecutar un ordenador, código de programa
caracterizado porque está adaptado para hacer que dicho
ordenador realice cualquiera de los métodos según una de las
reivindicaciones 1 a 11.
24. Estructura de datos para utilizar como una
entrada en un aparato clasificador, caracterizada porque se
obtiene al ejecutar cualquiera de los métodos según cualquiera de
las reivindicaciones 1 a 11.
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| EP00103810A EP1128278B1 (en) | 2000-02-23 | 2000-02-23 | Method and apparatus for processing electronic documents |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES2208164T3 true ES2208164T3 (es) | 2004-06-16 |
Family
ID=8167944
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES00103810T Expired - Lifetime ES2208164T3 (es) | 2000-02-23 | 2000-02-23 | Metodo y aparato para procesar documentos electronicos. |
Country Status (8)
| Country | Link |
|---|---|
| US (1) | US20080040660A1 (es) |
| EP (2) | EP1128278B1 (es) |
| JP (1) | JP4782346B2 (es) |
| AU (3) | AU2001233736A1 (es) |
| CA (1) | CA2401172C (es) |
| DE (1) | DE60005293T2 (es) |
| ES (1) | ES2208164T3 (es) |
| WO (1) | WO2001063467A1 (es) |
Families Citing this family (19)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| EP1049030A1 (en) | 1999-04-28 | 2000-11-02 | SER Systeme AG Produkte und Anwendungen der Datenverarbeitung | Classification method and apparatus |
| EP1182577A1 (en) | 2000-08-18 | 2002-02-27 | SER Systeme AG Produkte und Anwendungen der Datenverarbeitung | Associative memory |
| US9177828B2 (en) | 2011-02-10 | 2015-11-03 | Micron Technology, Inc. | External gettering method and device |
| AU2012258320B2 (en) * | 2001-08-27 | 2016-01-14 | Kofax International Switzerland Sàrl | A method for automatically indexing documents |
| ES2375403T3 (es) | 2001-08-27 | 2012-02-29 | BDGB Enterprise Software Sàrl | Un método para la indexación automática de documentos. |
| DE102004062784A1 (de) | 2004-12-21 | 2006-07-20 | Hiflex Software Gmbh | Verfahren zum Auslösen einer Kostenbuchung |
| US7853595B2 (en) | 2007-01-30 | 2010-12-14 | The Boeing Company | Method and apparatus for creating a tool for generating an index for a document |
| US8094976B2 (en) | 2007-10-03 | 2012-01-10 | Esker, Inc. | One-screen reconciliation of business document image data, optical character recognition extracted data, and enterprise resource planning data |
| US8108764B2 (en) | 2007-10-03 | 2012-01-31 | Esker, Inc. | Document recognition using static and variable strings to create a document signature |
| JP5412903B2 (ja) * | 2009-03-17 | 2014-02-12 | コニカミノルタ株式会社 | 文書画像処理装置、文書画像処理方法および文書画像処理プログラム |
| US9152883B2 (en) | 2009-11-02 | 2015-10-06 | Harry Urbschat | System and method for increasing the accuracy of optical character recognition (OCR) |
| US9158833B2 (en) * | 2009-11-02 | 2015-10-13 | Harry Urbschat | System and method for obtaining document information |
| US9213756B2 (en) | 2009-11-02 | 2015-12-15 | Harry Urbschat | System and method of using dynamic variance networks |
| US8321357B2 (en) | 2009-09-30 | 2012-11-27 | Lapir Gennady | Method and system for extraction |
| JP5387378B2 (ja) * | 2009-12-15 | 2014-01-15 | 富士通株式会社 | 文字同定装置及び文字同定方法 |
| US9002102B2 (en) * | 2012-12-21 | 2015-04-07 | Hewlett-Packard Development Company, L.P. | Generating training documents |
| US9213893B2 (en) * | 2013-05-23 | 2015-12-15 | Intuit Inc. | Extracting data from semi-structured electronic documents |
| US10482323B2 (en) * | 2017-08-22 | 2019-11-19 | Autonom8, Inc. | System and method for semantic textual information recognition |
| US11568207B2 (en) * | 2018-09-27 | 2023-01-31 | Deepmind Technologies Limited | Learning observation representations by predicting the future in latent space |
Family Cites Families (103)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US4731861A (en) * | 1983-08-26 | 1988-03-15 | Texas Instruments Incorporated | Method of optical character recognition |
| JPS61217863A (ja) * | 1985-03-23 | 1986-09-27 | Brother Ind Ltd | 電子辞書 |
| US4864501A (en) * | 1987-10-07 | 1989-09-05 | Houghton Mifflin Company | Word annotation system |
| EP0320266A3 (en) * | 1987-12-11 | 1992-03-11 | Hewlett-Packard Company | View composition in a data base management system |
| US5201047A (en) * | 1989-12-21 | 1993-04-06 | International Business Machines Corporation | Attribute-based classification and retrieval system |
| US5191525A (en) * | 1990-01-16 | 1993-03-02 | Digital Image Systems, Corporation | System and method for extraction of data from documents for subsequent processing |
| US5344132A (en) * | 1990-01-16 | 1994-09-06 | Digital Image Systems | Image based document processing and information management system and apparatus |
| FR2660085A1 (fr) * | 1990-03-20 | 1991-09-27 | Philips Electronique Lab | Dispositif de traitement de donnees et procede pour selectionner des mots de donnees contenus dans un dictionnaire. |
| JP3329806B2 (ja) * | 1990-11-09 | 2002-09-30 | 株式会社日立製作所 | ニューラルネット構築装置 |
| US5278980A (en) * | 1991-08-16 | 1994-01-11 | Xerox Corporation | Iterative technique for phrase query formation and an information retrieval system employing same |
| CA2077274C (en) * | 1991-11-19 | 1997-07-15 | M. Margaret Withgott | Method and apparatus for summarizing a document without document image decoding |
| JP2579397B2 (ja) * | 1991-12-18 | 1997-02-05 | インターナショナル・ビジネス・マシーンズ・コーポレイション | 文書画像のレイアウトモデルを作成する方法及び装置 |
| US5245672A (en) * | 1992-03-09 | 1993-09-14 | The United States Of America As Represented By The Secretary Of Commerce | Object/anti-object neural network segmentation |
| US5434953A (en) * | 1992-03-20 | 1995-07-18 | Xerox Corporation | Use of fast textured reduction for discrimination of document image components |
| US5748807A (en) * | 1992-10-09 | 1998-05-05 | Panasonic Technologies, Inc. | Method and means for enhancing optical character recognition of printed documents |
| US5491758A (en) * | 1993-01-27 | 1996-02-13 | International Business Machines Corporation | Automatic handwriting recognition using both static and dynamic parameters |
| US5649068A (en) * | 1993-07-27 | 1997-07-15 | Lucent Technologies Inc. | Pattern recognition system using support vectors |
| GB2281997B (en) * | 1993-09-20 | 1997-10-15 | Ricoh Kk | Method and apparatus for improving a text image by using character regeneration |
| US5619709A (en) * | 1993-09-20 | 1997-04-08 | Hnc, Inc. | System and method of context vector generation and retrieval |
| US5537491A (en) * | 1993-11-24 | 1996-07-16 | Xerox Corporation | Analyzing an image or other data to obtain a stable number of groups |
| US5742806A (en) * | 1994-01-31 | 1998-04-21 | Sun Microsystems, Inc. | Apparatus and method for decomposing database queries for database management system including multiprocessor digital data processing system |
| NZ248751A (en) * | 1994-03-23 | 1997-11-24 | Ryan John Kevin | Text analysis and coding |
| US5671333A (en) * | 1994-04-07 | 1997-09-23 | Lucent Technologies Inc. | Training apparatus and method |
| JP2618832B2 (ja) * | 1994-06-16 | 1997-06-11 | 日本アイ・ビー・エム株式会社 | 文書の論理構造の解析方法及びシステム |
| US5574802A (en) * | 1994-09-30 | 1996-11-12 | Xerox Corporation | Method and apparatus for document element classification by analysis of major white region geometry |
| US5689620A (en) * | 1995-04-28 | 1997-11-18 | Xerox Corporation | Automatic training of character templates using a transcription and a two-dimensional image source model |
| US5956419A (en) * | 1995-04-28 | 1999-09-21 | Xerox Corporation | Unsupervised training of character templates using unsegmented samples |
| US5675710A (en) * | 1995-06-07 | 1997-10-07 | Lucent Technologies, Inc. | Method and apparatus for training a text classifier |
| US5778397A (en) * | 1995-06-28 | 1998-07-07 | Xerox Corporation | Automatic method of generating feature probabilities for automatic extracting summarization |
| US6006221A (en) * | 1995-08-16 | 1999-12-21 | Syracuse University | Multilingual document retrieval system and method using semantic vector matching |
| US5889886A (en) * | 1995-11-28 | 1999-03-30 | Xerox Corporation | Method and apparatus for detecting running text in an image |
| US6009196A (en) * | 1995-11-28 | 1999-12-28 | Xerox Corporation | Method for classifying non-running text in an image |
| US6076088A (en) * | 1996-02-09 | 2000-06-13 | Paik; Woojin | Information extraction system and method using concept relation concept (CRC) triples |
| US5864855A (en) * | 1996-02-26 | 1999-01-26 | The United States Of America As Represented By The Secretary Of The Army | Parallel document clustering process |
| JP2987099B2 (ja) * | 1996-03-27 | 1999-12-06 | 株式会社日立国際ビジネス | 文書作成支援システム及び用語辞書 |
| US5787201A (en) * | 1996-04-09 | 1998-07-28 | The United States Of America As Represented By The Secretary Of The Navy | High order fractal feature extraction for classification of objects in images |
| US5937084A (en) * | 1996-05-22 | 1999-08-10 | Ncr Corporation | Knowledge-based document analysis system |
| US5835638A (en) * | 1996-05-30 | 1998-11-10 | Xerox Corporation | Method and apparatus for comparing symbols extracted from binary images of text using topology preserved dilated representations of the symbols |
| US6101515A (en) * | 1996-05-31 | 2000-08-08 | Oracle Corporation | Learning system for classification of terminology |
| US5778362A (en) * | 1996-06-21 | 1998-07-07 | Kdl Technologies Limted | Method and system for revealing information structures in collections of data items |
| DE19627472A1 (de) * | 1996-07-08 | 1998-01-15 | Ser Systeme Ag | Datenbanksystem |
| US5918223A (en) * | 1996-07-22 | 1999-06-29 | Muscle Fish | Method and article of manufacture for content-based analysis, storage, retrieval, and segmentation of audio information |
| US5745889A (en) * | 1996-08-09 | 1998-04-28 | Digital Equipment Corporation | Method for parsing information of databases records using word-location pairs and metaword-location pairs |
| WO1998012616A2 (en) * | 1996-09-23 | 1998-03-26 | Lowrie Mcintosh | Defining a uniform subject classification system incorporating document management/records retention functions |
| US6275610B1 (en) * | 1996-10-16 | 2001-08-14 | Convey Corporation | File structure for scanned documents |
| JPH10240958A (ja) * | 1996-12-27 | 1998-09-11 | Fujitsu Ltd | 画像から管理情報を抽出する管理情報抽出装置および方法 |
| US6327387B1 (en) * | 1996-12-27 | 2001-12-04 | Fujitsu Limited | Apparatus and method for extracting management information from image |
| US6687404B1 (en) * | 1997-06-20 | 2004-02-03 | Xerox Corporation | Automatic training of layout parameters in a 2D image model |
| US6353840B2 (en) * | 1997-08-15 | 2002-03-05 | Ricoh Company, Ltd. | User-defined search template for extracting information from documents |
| US6665841B1 (en) * | 1997-11-14 | 2003-12-16 | Xerox Corporation | Transmission of subsets of layout objects at different resolutions |
| US5999664A (en) * | 1997-11-14 | 1999-12-07 | Xerox Corporation | System for searching a corpus of document images by user specified document layout components |
| US5987457A (en) * | 1997-11-25 | 1999-11-16 | Acceleration Software International Corporation | Query refinement method for searching documents |
| US6115708A (en) * | 1998-03-04 | 2000-09-05 | Microsoft Corporation | Method for refining the initial conditions for clustering with applications to small and large database clustering |
| JP3422924B2 (ja) * | 1998-03-27 | 2003-07-07 | 富士通株式会社 | 文字認識装置、文字認識方法およびその方法をコンピュータに実行させるプログラムを記録したコンピュータ読み取り可能な記録媒体 |
| US6161130A (en) * | 1998-06-23 | 2000-12-12 | Microsoft Corporation | Technique which utilizes a probabilistic classifier to detect "junk" e-mail by automatically updating a training and re-training the classifier based on the updated training set |
| US6192360B1 (en) * | 1998-06-23 | 2001-02-20 | Microsoft Corporation | Methods and apparatus for classifying text and for building a text classifier |
| US6243713B1 (en) * | 1998-08-24 | 2001-06-05 | Excalibur Technologies Corp. | Multimedia document retrieval by application of multimedia queries to a unified index of multimedia data for a plurality of multimedia data types |
| US6324551B1 (en) * | 1998-08-31 | 2001-11-27 | Xerox Corporation | Self-contained document management based on document properties |
| US6212532B1 (en) * | 1998-10-22 | 2001-04-03 | International Business Machines Corporation | Text categorization toolkit |
| US6574632B2 (en) * | 1998-11-18 | 2003-06-03 | Harris Corporation | Multiple engine information retrieval and visualization system |
| US6622134B1 (en) * | 1999-01-05 | 2003-09-16 | International Business Machines Corporation | Method of constructing data classifiers and classifiers constructed according to the method |
| WO2000042563A2 (en) * | 1999-01-13 | 2000-07-20 | Computer Associates Think, Inc. | Signature recognition system and method |
| US6477551B1 (en) * | 1999-02-16 | 2002-11-05 | International Business Machines Corporation | Interactive electronic messaging system |
| US6629097B1 (en) * | 1999-04-28 | 2003-09-30 | Douglas K. Keith | Displaying implicit associations among items in loosely-structured data sets |
| EP1049030A1 (en) * | 1999-04-28 | 2000-11-02 | SER Systeme AG Produkte und Anwendungen der Datenverarbeitung | Classification method and apparatus |
| US6611825B1 (en) * | 1999-06-09 | 2003-08-26 | The Boeing Company | Method and system for text mining using multidimensional subspaces |
| US6501855B1 (en) * | 1999-07-20 | 2002-12-31 | Parascript, Llc | Manual-search restriction on documents not having an ASCII index |
| US6785810B1 (en) * | 1999-08-31 | 2004-08-31 | Espoc, Inc. | System and method for providing secure transmission, search, and storage of data |
| US6453315B1 (en) * | 1999-09-22 | 2002-09-17 | Applied Semantics, Inc. | Meaning-based information organization and retrieval |
| US6990238B1 (en) * | 1999-09-30 | 2006-01-24 | Battelle Memorial Institute | Data processing, analysis, and visualization system for use with disparate data types |
| US6188010B1 (en) * | 1999-10-29 | 2001-02-13 | Sony Corporation | Music search by melody input |
| DE19952769B4 (de) * | 1999-11-02 | 2008-07-17 | Sap Ag | Suchmaschine und Verfahren zum Abrufen von Informationen mit Abfragen in natürlicher Sprache |
| US6694053B1 (en) * | 1999-12-02 | 2004-02-17 | Hewlett-Packard Development, L.P. | Method and apparatus for performing document structure analysis |
| US7149347B1 (en) * | 2000-03-02 | 2006-12-12 | Science Applications International Corporation | Machine learning of document templates for data extraction |
| US7213024B2 (en) * | 2000-03-09 | 2007-05-01 | The Web Access, Inc. | Method and apparatus for accessing information within an electronic system |
| US6741724B1 (en) * | 2000-03-24 | 2004-05-25 | Siemens Dematic Postal Automation, L.P. | Method and system for form processing |
| US20070033252A1 (en) * | 2000-03-30 | 2007-02-08 | Combest Ricky F | Dynamic virtual network and method |
| JP2001318948A (ja) * | 2000-05-09 | 2001-11-16 | Hitachi Ltd | 文書検索方法及び装置並びにその処理プログラムを記憶した媒体 |
| WO2001090921A2 (en) * | 2000-05-25 | 2001-11-29 | Kanisa, Inc. | System and method for automatically classifying text |
| US6895552B1 (en) * | 2000-05-31 | 2005-05-17 | Ricoh Co., Ltd. | Method and an apparatus for visual summarization of documents |
| US6944340B1 (en) * | 2000-08-07 | 2005-09-13 | Canon Kabushiki Kaisha | Method and apparatus for efficient determination of recognition parameters |
| EP1182577A1 (en) * | 2000-08-18 | 2002-02-27 | SER Systeme AG Produkte und Anwendungen der Datenverarbeitung | Associative memory |
| US6766316B2 (en) * | 2001-01-18 | 2004-07-20 | Science Applications International Corporation | Method and system of ranking and clustering for document indexing and retrieval |
| US20020156816A1 (en) * | 2001-02-13 | 2002-10-24 | Mark Kantrowitz | Method and apparatus for learning from user self-corrections, revisions and modifications |
| US6732090B2 (en) * | 2001-08-13 | 2004-05-04 | Xerox Corporation | Meta-document management system with user definable personalities |
| ES2375403T3 (es) * | 2001-08-27 | 2012-02-29 | BDGB Enterprise Software Sàrl | Un método para la indexación automática de documentos. |
| JP4006239B2 (ja) * | 2002-02-21 | 2007-11-14 | 株式会社日立製作所 | 文書の検索方法および検索システム |
| JP4366108B2 (ja) * | 2003-04-30 | 2009-11-18 | キヤノン株式会社 | 文書検索装置、文書検索方法及びコンピュータプログラム |
| JP2005043977A (ja) * | 2003-07-23 | 2005-02-17 | Hitachi Ltd | 文書間の類似度算出方法および装置 |
| US7805446B2 (en) * | 2004-10-12 | 2010-09-28 | Ut-Battelle Llc | Agent-based method for distributed clustering of textual information |
| US8570586B2 (en) * | 2005-05-02 | 2013-10-29 | Digimarc Corporation | Active images through digital watermarking |
| US7472121B2 (en) * | 2005-12-15 | 2008-12-30 | International Business Machines Corporation | Document comparison using multiple similarity measures |
| US8090743B2 (en) * | 2006-04-13 | 2012-01-03 | Lg Electronics Inc. | Document management system and method |
| WO2007149004A1 (en) * | 2006-06-13 | 2007-12-27 | Freescale Semiconductor, Inc. | Methods and apparatus for simulating distributed effects |
| US7945627B1 (en) * | 2006-09-28 | 2011-05-17 | Bitdefender IPR Management Ltd. | Layout-based electronic communication filtering systems and methods |
| US7610281B2 (en) * | 2006-11-29 | 2009-10-27 | Oracle International Corp. | Efficient computation of document similarity |
| US7720721B1 (en) * | 2006-12-28 | 2010-05-18 | Amazon Technologies, Inc. | Method and system for analyzing user interaction to identify documents associated with dissimilar items that may contain synonyms |
| WO2008097194A1 (en) * | 2007-02-09 | 2008-08-14 | Agency For Science, Technology And Research | Keyword classification and determination in language modelling |
| US8280877B2 (en) * | 2007-02-22 | 2012-10-02 | Microsoft Corporation | Diverse topic phrase extraction |
| US20080212877A1 (en) * | 2007-03-04 | 2008-09-04 | John Franco | High speed error detection and correction for character recognition |
| US20090228777A1 (en) * | 2007-08-17 | 2009-09-10 | Accupatent, Inc. | System and Method for Search |
| US20090198677A1 (en) * | 2008-02-05 | 2009-08-06 | Nuix Pty.Ltd. | Document Comparison Method And Apparatus |
| JP4538507B2 (ja) * | 2008-05-02 | 2010-09-08 | シャープ株式会社 | 画像照合方法、画像照合装置、画像データ出力処理装置、プログラム及び記憶媒体 |
-
2000
- 2000-02-23 ES ES00103810T patent/ES2208164T3/es not_active Expired - Lifetime
- 2000-02-23 DE DE60005293T patent/DE60005293T2/de not_active Expired - Lifetime
- 2000-02-23 EP EP00103810A patent/EP1128278B1/en not_active Expired - Lifetime
-
2001
- 2001-02-02 JP JP2001562361A patent/JP4782346B2/ja not_active Expired - Lifetime
- 2001-02-02 WO PCT/EP2001/001132 patent/WO2001063467A1/en not_active Ceased
- 2001-02-02 CA CA2401172A patent/CA2401172C/en not_active Expired - Lifetime
- 2001-02-02 EP EP01905729A patent/EP1259903A1/en not_active Withdrawn
- 2001-02-02 AU AU2001233736A patent/AU2001233736A1/en not_active Abandoned
- 2001-02-02 US US10/204,756 patent/US20080040660A1/en not_active Abandoned
-
2007
- 2007-05-25 AU AU2007202382A patent/AU2007202382B2/en not_active Expired
-
2009
- 2009-08-14 AU AU2009208162A patent/AU2009208162A1/en not_active Abandoned
Also Published As
| Publication number | Publication date |
|---|---|
| EP1259903A1 (en) | 2002-11-27 |
| AU2007202382A1 (en) | 2007-06-14 |
| CA2401172A1 (en) | 2001-08-30 |
| JP4782346B2 (ja) | 2011-09-28 |
| WO2001063467A1 (en) | 2001-08-30 |
| AU2001233736A1 (en) | 2001-09-03 |
| DE60005293D1 (de) | 2003-10-23 |
| CA2401172C (en) | 2012-01-24 |
| AU2009208162A1 (en) | 2009-09-10 |
| DE60005293T2 (de) | 2004-07-01 |
| EP1128278A1 (en) | 2001-08-29 |
| JP2003524258A (ja) | 2003-08-12 |
| AU2007202382B2 (en) | 2009-06-04 |
| EP1128278B1 (en) | 2003-09-17 |
| US20080040660A1 (en) | 2008-02-14 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| AU2007202382B2 (en) | Method and apparatus for processing electronic documents | |
| Ha et al. | Information extraction from scanned invoice images using text analysis and layout features | |
| Das et al. | A statistical–topological feature combination for recognition of handwritten numerals | |
| Mouchère et al. | Advancing the state of the art for handwritten math recognition: the CROHME competitions, 2011–2014 | |
| EP1362322B1 (en) | Holistic-analytical recognition of handwritten text | |
| US20110103689A1 (en) | System and method for obtaining document information | |
| Saabni et al. | Comprehensive synthetic Arabic database for on/off-line script recognition research | |
| US20150310269A1 (en) | System and Method of Using Dynamic Variance Networks | |
| Lee et al. | Deep learning-based digitalization of a part catalog book to generate part specification by a neutral reference data dictionary | |
| Fischer | Handwriting recognition in historical documents | |
| US20230419706A1 (en) | Method to identify and extract tables from semi-structured documents | |
| Nayak et al. | Odia running text recognition using moment-based feature extraction and mean distance classification technique | |
| Assabie et al. | Writer-independent offline recognition of handwritten Ethiopic characters | |
| Nagy et al. | Adaptive and interactive approaches to document analysis | |
| Madhvanath et al. | Perceptual features for off-line handwritten word recognition: a framework for heuristic prediction, representation and matching | |
| Indermühle | Analysis of digital link in electronic documents | |
| Balasooriya | Improving and Measuring OCR Accuracy for Sinhala with Tesseract OCR Engine | |
| JP7410532B2 (ja) | 文字判定装置及び文字判定プログラム | |
| Kaur et al. | Adverse conditions and techniques for cross-lingual text recognition | |
| JPWO2017013719A1 (ja) | 文字認識装置、文字認識方法及び文字認識プログラム | |
| Prasad et al. | Trends in handwriting recognition | |
| US20250391192A1 (en) | Information processing apparatus, non-transitory computer readable recording medium, and information processing method | |
| Krayem | A high level approach to Arabic sentence recognition | |
| Kumar et al. | Preparation of a dataset and issues related with recognition of optical character in as samese script | |
| Imama et al. | A Slice-based Character Recognition Technique for Handwritten Devanagari Script |