ES2712131T3 - Método de formalización y estructuración de información multinivel y multiestructural y aparato asociado - Google Patents

Método de formalización y estructuración de información multinivel y multiestructural y aparato asociado Download PDF

Info

Publication number
ES2712131T3
ES2712131T3 ES12825060T ES12825060T ES2712131T3 ES 2712131 T3 ES2712131 T3 ES 2712131T3 ES 12825060 T ES12825060 T ES 12825060T ES 12825060 T ES12825060 T ES 12825060T ES 2712131 T3 ES2712131 T3 ES 2712131T3
Authority
ES
Spain
Prior art keywords
information
file
digital information
objects
digital
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
ES12825060T
Other languages
English (en)
Inventor
Alexander Zhirkov
Alexey Oraevsky
Andrei Grichine
George Blondheim
Max Wandinger
Wade Attwood
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
General Harmonics Int Inc
Original Assignee
General Harmonics Int Inc
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by General Harmonics Int Inc filed Critical General Harmonics Int Inc
Application granted granted Critical
Publication of ES2712131T3 publication Critical patent/ES2712131T3/es
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/10File systems; File servers
    • G06F16/13File access structures, e.g. distributed indices
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/10File systems; File servers
    • G06F16/18File system types
    • G06F16/185Hierarchical storage management [HSM] systems, e.g. file migration or policies thereof
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/20Information retrieval; Database structures therefor; File system structures therefor of structured data, e.g. relational data
    • G06F16/28Databases characterised by their database models, e.g. relational or object models
    • G06F16/284Relational databases
    • G06F16/285Clustering or classification
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10HELECTROPHONIC MUSICAL INSTRUMENTS; INSTRUMENTS IN WHICH THE TONES ARE GENERATED BY ELECTROMECHANICAL MEANS OR ELECTRONIC GENERATORS, OR IN WHICH THE TONES ARE SYNTHESISED FROM A DATA STORE
    • G10H1/00Details of electrophonic musical instruments
    • G10H1/0008Associated control or indicating means
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/0017Lossless audio signal coding; Perfect reconstruction of coded audio signal by transmission of coding error
    • HELECTRICITY
    • H03ELECTRONIC CIRCUITRY
    • H03MCODING; DECODING; CODE CONVERSION IN GENERAL
    • H03M7/00Conversion of a code where information is represented by a given sequence or number of digits to a code where the same, similar or subset of information is represented by a different sequence or number of digits
    • H03M7/30Compression; Expansion; Suppression of unnecessary data, e.g. redundancy reduction
    • H03M7/55Compression Theory, e.g. compression of random number, repeated compression
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10HELECTROPHONIC MUSICAL INSTRUMENTS; INSTRUMENTS IN WHICH THE TONES ARE GENERATED BY ELECTROMECHANICAL MEANS OR ELECTRONIC GENERATORS, OR IN WHICH THE TONES ARE SYNTHESISED FROM A DATA STORE
    • G10H2240/00Data organisation or data communication aspects, specifically adapted for electrophonic musical tools or instruments
    • G10H2240/091Info, i.e. juxtaposition of unrelated auxiliary information or commercial messages with or between music files
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10HELECTROPHONIC MUSICAL INSTRUMENTS; INSTRUMENTS IN WHICH THE TONES ARE GENERATED BY ELECTROMECHANICAL MEANS OR ELECTRONIC GENERATORS, OR IN WHICH THE TONES ARE SYNTHESISED FROM A DATA STORE
    • G10H2240/00Data organisation or data communication aspects, specifically adapted for electrophonic musical tools or instruments
    • G10H2240/171Transmission of musical instrument data, control or status information; Transmission, remote access or control of music data for electrophonic musical instruments
    • G10H2240/181Billing, i.e. purchasing of data contents for use with electrophonic musical instruments; Protocols therefor; Management of transmission or connection time therefor
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10HELECTROPHONIC MUSICAL INSTRUMENTS; INSTRUMENTS IN WHICH THE TONES ARE GENERATED BY ELECTROMECHANICAL MEANS OR ELECTRONIC GENERATORS, OR IN WHICH THE TONES ARE SYNTHESISED FROM A DATA STORE
    • G10H2240/00Data organisation or data communication aspects, specifically adapted for electrophonic musical tools or instruments
    • G10H2240/325Synchronizing two or more audio tracks or files according to musical features or musical timings
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10HELECTROPHONIC MUSICAL INSTRUMENTS; INSTRUMENTS IN WHICH THE TONES ARE GENERATED BY ELECTROMECHANICAL MEANS OR ELECTRONIC GENERATORS, OR IN WHICH THE TONES ARE SYNTHESISED FROM A DATA STORE
    • G10H2250/00Aspects of algorithms or signal processing methods without intrinsic musical character, yet specifically adapted for or used in electrophonic musical processing
    • G10H2250/131Mathematical functions for musical analysis, processing, synthesis or composition
    • G10H2250/215Transforms, i.e. mathematical transforms into domains appropriate for musical signal processing, coding or compression
    • G10H2250/221Cosine transform; DCT [discrete cosine transform], e.g. for use in lossy audio compression such as MP3
    • G10H2250/225MDCT [Modified discrete cosine transform], i.e. based on a DCT of overlapping data
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10HELECTROPHONIC MUSICAL INSTRUMENTS; INSTRUMENTS IN WHICH THE TONES ARE GENERATED BY ELECTROMECHANICAL MEANS OR ELECTRONIC GENERATORS, OR IN WHICH THE TONES ARE SYNTHESISED FROM A DATA STORE
    • G10H2250/00Aspects of algorithms or signal processing methods without intrinsic musical character, yet specifically adapted for or used in electrophonic musical processing
    • G10H2250/541Details of musical waveform synthesis, i.e. audio waveshape processing from individual wavetable samples, independently of their origin or of the sound they represent
    • G10H2250/571Waveform compression, adapted for music synthesisers, sound banks or wavetables
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10HELECTROPHONIC MUSICAL INSTRUMENTS; INSTRUMENTS IN WHICH THE TONES ARE GENERATED BY ELECTROMECHANICAL MEANS OR ELECTRONIC GENERATORS, OR IN WHICH THE TONES ARE SYNTHESISED FROM A DATA STORE
    • G10H2250/00Aspects of algorithms or signal processing methods without intrinsic musical character, yet specifically adapted for or used in electrophonic musical processing
    • G10H2250/541Details of musical waveform synthesis, i.e. audio waveshape processing from individual wavetable samples, independently of their origin or of the sound they represent
    • G10H2250/571Waveform compression, adapted for music synthesisers, sound banks or wavetables
    • G10H2250/575Adaptive MDCT-based compression, e.g. using a hybrid subband-MDCT, as in ATRAC

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Databases & Information Systems (AREA)
  • General Engineering & Computer Science (AREA)
  • Data Mining & Analysis (AREA)
  • General Physics & Mathematics (AREA)
  • Multimedia (AREA)
  • Acoustics & Sound (AREA)
  • Computational Linguistics (AREA)
  • Signal Processing (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)
  • Signal Processing For Digital Recording And Reproducing (AREA)

Abstract

Un método para estructurar información que comprende información digital, comprendiendo dicho método: analizar un archivo de información digital original para determinar cuántos elementos de datos se incluyen en el archivo de información digital, y un valor de información original asociado con cada elemento de datos de este tipo, y por lo tanto una cantidad de información original y un valor de información original asociados con el archivo de información digital original; aplicar un proceso de manipulación inicial al archivo de información digital original para formar un primer archivo de información digital resultante, y aplicar un proceso de manipulación posterior al primer archivo de información digital resultante para formar un segundo archivo de información digital resultante, estando cada proceso de manipulación configurado para, al menos uno de, eliminar al menos un elemento del archivo de información digital procesado, y representar una combinación de una pluralidad de elementos del archivo de información digital procesado con un elemento representativo y una primera indicación asociada con una interrelación entre el elemento representativo y al menos uno de la pluralidad de elementos en la combinación, para reducir la cantidad de información de, y para estructurar el archivo de información digital procesado, estando el al menos uno del elemento eliminado y el elemento representativo determinados para reducir el valor de información del archivo de información digital procesado en no más que un umbral seleccionado; y aplicar sucesivamente procesos de manipulación al archivo de información digital previamente resultante hasta que las aplicaciones de proceso de manipulación sucesivas no logren una reducción de umbral en la cantidad de información en el archivo de información digital resultante posterior sobre el archivo de información digital previamente resultante, teniendo de este modo el último archivo de información digital resultante un estructura primaria con una cantidad de información reducida con respecto a la cantidad de información original y un valor de información resultante dentro del umbral seleccionado del valor de información original.

Description

DESCRIPCION
Metodo de formalizacion y estructuracion de informacion multinivel y multiestructural y aparato asociado SOLICITUDES RELACIONADAS
Esta solicitud reivindica la prioridad de las solicitudes provisionales de Estados Unidos numero 61/525.629 y 61/588.101, presentadas el 19 de 2011 y el 18 de enero de 2012.
ANTECEDENTES DE LA DESCRIPCION
Campo de la descripcion
Los aspectos de la presente descripcion se refieren al procesamiento de informacion para lograr la formalizacion y estructuracion, incluido el analisis de audio, la manipulacion y la representacion, y, mas particularmente, a sistemas y metodos de analisis estructurado y la determinacion de la relacion entre el valor de la informacion y la cantidad de informacion relacionada con los datos configurados armonicamente, incluidos medios digitales.
Descripcion de la tecnica relacionada
El artfculo COIFMAN ET AL: "Entropy-Based Algorithms for Best Basis Selection", IEEE TRANSACTIONS ON INFORMATION THEORY, IEEE PRESS, EE.UU., vol. 38, n.° 2, 1 de marzo de 1992 (01-03-1992), paginas 713-718, XP002316486, ISSN: 0018-9448, DOl: 10.1109/18.119732 describe un metodo que permite la compresion eficiente de una diversidad de senales tales como sonido e imagenes.
Un estandar generalmente reconocido para el concepto de audio unificado u otra formalizacion de datos digitales puede no estar generalmente disponible en la tecnica, aunque pueden implementarse diversas tecnicas para lograr lo mismo. Por ejemplo, algunas tecnicas emplean representaciones de audio simplificadas de una senal de sonido, que incluyen principalmente el reconocimiento de voz y la sfntesis de voz, asf como la compresion de datos digitales que representan musica. En un aspecto, las tecnologfas del habla han progresado desde la representacion de senales de sonido a traves de la forma de onda correspondiente, aunque dichas tecnicas a menudo funcionan sobre la base de palabras o incluso de frases completas en los datos de voz. Tal base en palabras/frases representa una forma de informacion que esta mas cerca de la percepcion natural del cerebro humano. En contraste, las tecnologfas de formalizacion implementadas para la representacion de musica generalmente usan solo una representacion de informacion ffsicamente perceptiva, es decir, en una forma cercana a la de la percepcion ffsica del sonido por el ofdo humano.
Hasta la fecha, otros intentos de obtener una representacion universal de la musica mas abstracta siguen siendo en gran medida infructuosos. Dicha falta de exito puede atribuirse, por ejemplo, al hecho de que la informacion del habla incluye una forma de lenguaje primario y la sintaxis de su descripcion, disenada con matematicas precisas que han sido establecidas y afinadas por muchas generaciones. En contraste, las representaciones de musica existentes, por ejemplo, basadas en notas o muestras de sonido, son relativamente primitivas en comparacion con el analisis de la informacion del habla y, por lo general, tales representaciones no son universalmente aplicables. En este sentido, una de las representaciones digitales de sonido relativamente mas informativas actualmente disponibles puede ser el formato PCM, generalmente denominado audio sin comprimir. Sin embargo, aunque tal formato puede ser relativamente mas informativo, tal informatividad se compensa con un tamano del archivo de datos relativamente grande. El gran tamano del archivo de datos, a su vez, puede hacer que tal formato o representacion sea inadecuada o impracticable, por ejemplo, para una entrega/transmision rapida y/o almacenamiento compacto. Si se desean dichos atributos, se han desarrollado o se estan desarrollando representaciones mas compactas, aunque probablemente menos informativas, que generalmente emplean un enfoque popular para la reduccion de datos, tal como se utiliza, por ejemplo, en MP3, OGG, WMA y otros modelos o representaciones psicoacusticas clasicas. Sin embargo, los sonidos naturales incluyen mas redundancia que las representaciones/modelos tfpicos de senales de audio que son capaces de analizar de manera eficaz. Ademas, la percepcion humana de la musica es generalmente mucho mas compleja que cualquier modelo psicoacustico existente. Como tal, existe la necesidad de un enfoque mejorado para la formalizacion del sonido que sea capaz de representar el sonido, el audio, la musica y/o cualquier otro dato digital relacionado con los armonicos de una manera mas compacta (es decir, menos intensiva en datos), pero de manera mas informativa (es decir, en terminos de la integridad de la representacion que se puede proporcionar).
En los esfuerzos para satisfacer esta demanda, se han desarrollado representaciones/modelos mas progresivos que se estan empleando actualmente, por ejemplo, en MP3-Pro, HE AAC, Mp3 PlusV, MPEG-4 SSC, audio estructurado MPEG 4 y MIDI. MP3-Pro y HE AAC utilizan esencialmente las peculiaridades de la percepcion humana como la base para extraer elementos de estructura en una senal de audio, sin conservar la busqueda especffica de fase y similitud en la senal. Las frecuencias bajas se replican en las frecuencias altas, sin conservar la fase, pero conservando el principio de similitud y los parametros generales de sonido, tal como la conservacion de la energfa y la naturaleza caotica de la senal. MP3-PlusV extrae, almacena y genera armonicos, sin conservar la fase, y tambien se puede aplicar para determinar la parte de alta frecuencia de la senal. MPEG-4 SSC (codificacion sinusoidal) es un metodo para representar la senal como un conjunto de objetos organizados, tales como armonicos, aciertos y ruido. Sin embargo, tal metodo para extraer estos objetos de la senal es diferente al esquema de percepcion que tiene lugar naturalmente con el cerebro humano. Por lo tanto, la reproduccion de la senal de esta representacion/modelo puede incluir artefactos no deseados. El audio estructurado MPEG-4 intenta representar el sonido mediante un algoritmo unificado que es capaz de generar una diversidad de estructuras de sonido. Si bien este enfoque puede tener cierto potencial, la creacion de tal algoritmo puede ser problematica debido a los recursos computacionales requeridos. El formato MIDI generalmente requiere un tamano de archivo de datos relativamente mas pequeno, pero, al igual que el audio estructurado MPEG-4, es una representacion/modelo que generalmente es adecuado para la escritura manual de musica, y no para la representacion de sonidos de origen natural y/o composiciones de audio ya creadas.
Por lo tanto, aunque se hacen esfuerzos mas avanzado para reducir o eliminar la redundancia perceptiva inherente en una senal de audio, en comparacion con los metodos o modelos psicoacusticos clasicos, las representaciones/modelos de sonido existentes estructurados y orientados a objetos pueden tender a perder el alcance de la informatividad de la senal inicial a una tasa de bits baja (es decir, gran cantidad de informacion) y, por lo tanto, no pueden conservar la calidad de la senal de audio original con un grado aceptable de tolerancia, ya que la representacion/modelo de sonido produce un tamano de archivo de datos mas compacto. Por consiguiente, existe la necesidad de un esquema de formalizacion y disposicion para los medios digitales, tal como el audio, que sea capaz de reducir la cantidad de informacion o la tasa de bits de un archivo de informacion digital mediante una estructuracion apropiada, mientras que conserva un valor de informacion dentro de un umbral de o incluso mayor que el archivo de informacion digital original.
BREVE RESUMEN DE LA DESCRIPCION
Las necesidades anteriores y otras se satisfacen mediante aspectos de la presente descripcion, en donde uno de dichos aspectos se refiere al uso de estructuras altamente organizadas y parametros como metricas de senal de audio solamente. Otro aspecto incluye un metodo de crecimiento sucesivo de una diversidad de estructuras de sonido a partir de primotrones de informacion u otros elementos de datos para crear estructuras complejas, pero mas compactas (con respecto al tamano del archivo de datos) y ricas en informacion. Las estructuras de nivel de orden superior consisten en primotrones de informacion de sonido que pueden ser localizados en el tiempo, localizados en la frecuencia o tener una localizacion hfbrida (es decir, tiempo-frecuencia), en donde la informatividad en combinacion con el tamano relativamente bajo del archivo de datos proporcionado por aspectos de la tecnologfa descrita.
Como se usa en el presente documento, un "primotron" se puede definir como elementos o estructuras de datos representativos primarios que incluyen objetos o entidades multinivel y multiestructurales (MSML) para la formalizacion digital de medios tales como sonido o audio, que pueden utilizarse para crear estructuras complejas, pero mas compactas (con respecto al tamano del archivo de datos), ricas en informacion. Las estructuras de nivel de orden superior de los primotrones de informacion de sonido pueden ser localizadas en el tiempo, localizadas en la frecuencia o tener una localizacion hfbrida (es decir, tiempo-frecuencia). Los primotrones localizados en el tiempo pueden generar ataques y aciertos, y un ritmo de nivel superior (con respecto al audio), mientras que los primotrones localizados en la frecuencia son el origen de los armonicos, un modelo de sobretono de nivel superior, y melodfas recurrentes de nivel superior. Generalmente, un primotron, determinado por aspectos de un metodo de formalizacion como se describe en el presente documento, representa un patron o combinacion de uno o mas bits o elementos de datos en los diversos niveles y/o dimensiones de la matriz de bits del archivo de audio digital, y se deduce que el archivo de audio digital puede representarse posteriormente mediante una combinacion de dichos primotrones identificados y/o determinados a incluir en el mismo. La evolucion o "historia de vida" de dichos patrones puede caracterizarse adicionalmente por los principios de evolucion de la informacion en un sistema caotico dinamico definido por un numero finito de estructuras, concretamente, los primotrones tienen cada uno una "vida util" que puede variar desde una fraccion de segundo hasta varios minutos dentro del tiempo o la duracion del tiempo frecuencia del archivo de audio digital. Debido a que el archivo de audio digital ahora esta representado por tal combinacion o sistema vivo de primotrones, en donde cada primotron representa un subconjunto de bits de la matriz de bits para u otra estructura o entidad asociada con ese archivo de audio digital, el archivo de audio MSML que incluye la combinacion identificada de primotrones puede presentar, por ejemplo, un tamano del archivo de datos reducido (cantidad de informacion) en comparacion con el archivo de audio digitalizado original (al mismo tiempo que conserva la calidad de la informacion del archivo de audio digital dentro de un umbral perceptivo del archivo de audio digital original). Dichos primotrones pueden facilitar la reduccion en la cantidad de informacion o la tasa de bits para el archivo de audio digital en particular, al tiempo que conservan la informatividad del archivo de audio digital dentro de un umbral perceptivo del archivo de audio digital original. Por consiguiente, tal formato de datos digitales multifuncional y altamente estructurado puede configurarse para un almacenamiento y reproduccion altamente compactos y eficaces de cualquier material representado en forma de una senal de audio de alta fidelidad de base o construccion armonica (incluyendo musica, voz y otros medios basados en un sonido rico), dentro de un umbral de la senal de datos digital original.
Desde otra perspectiva, los aspectos de la presente descripcion proporcionan sistemas y metodos para representar una composicion de sonido como una formalizacion multinivel y multiestructural (MSML), en donde cualquier nivel de estructura relativamente superior de la composicion de sonido puede configurarse como una integracion de los elementos de un nivel relativamente inferior de la composicion del sonido utilizando, por ejemplo, los criterios de informacion perceptiva (PIC). Los PIC se consideran satisfechos, por ejemplo, si la informacion perceptiva de un nivel es menor que la suma de los valores de informacion de los elementos constituyentes independientes de ese nivel. Un nivel cero se define como un nivel en el que la cantidad de informacion es equivalente a la "entropfa perceptiva". Los niveles de orden superior incluyen primotrones de informacion de sonido (o estructuras de sonido primarias) que pueden estar localizadas en el tiempo, localizadas en la frecuencia y/o tener una localizacion hfbrida. Las privaciones de informacion pueden generar una estructura de sonido de orden superior, que puede incluir fonemas para senales de voz. Los primotrones localizados en el tiempo pueden generar ataques y aciertos, y un ritmo de nivel superior. Los primotrones localizados en la frecuencia pueden asociarse con el origen de los armonicos, despues los modelos de sobretono de nivel superior, y despues las melodfas recurrentes de nivel superior. Una vez construida, la formalizacion MSML de cada composicion o senal de sonido puede estar compuesta por, transformarse con o en, o combinarse de otra manera con la formalizacion MSML de otra composicion o senal de sonido, formando de este modo estructuras semanticas MSML de nivel superior mas complejas.
Mas particularmente, los aspectos de la presente descripcion proporcionan metodos y sistemas para estructurar la informacion. Dichos metodos y sistemas generalmente implican el analisis de un archivo de informacion digital original para determinar una cantidad de informacion original y un valor de informacion original asociado con la misma. Despues, se aplica un proceso de manipulacion inicial al archivo de informacion digital original para formar un primer archivo de informacion digital resultante, y despues se puede aplicar un proceso de manipulacion posterior al primer archivo de informacion digital resultante para formar un segundo archivo de informacion digital resultante. Cada proceso de manipulacion esta configurado para eliminar al menos un elemento del archivo de informacion digital procesado, y/o representar una combinacion de una pluralidad de elementos del archivo de informacion digital procesado con un elemento representativo y una primera indicacion asociada con una interrelacion entre el elemento representante y al menos uno de la pluralidad de elementos en la combinacion, a fin de reducir la cantidad de informacion y estructurar el archivo de informacion digital procesado. El elemento eliminado y/o el elemento representativo se determinan para reducir el valor de informacion del archivo de informacion digital procesado en no mas de un umbral seleccionado con respecto al archivo de informacion digital original. Dichos procesos de manipulacion se aplican sucesivamente al archivo de informacion digital previamente resultante hasta que las aplicaciones de proceso de manipulacion sucesivas no logran una reduccion de umbral en la cantidad de informacion en el archivo de informacion digital resultante posterior sobre el archivo de informacion digital previamente resultante. Por lo tanto, el ultimo archivo de informacion digital resultante se designa con una estructura primaria con una cantidad de informacion reducida con respecto a la cantidad de informacion original y un valor de informacion resultante dentro del umbral seleccionado del valor de informacion original.
De acuerdo con otro aspecto, pueden proporcionarse sistemas y metodos para el ancho de banda y la reduccion de la velocidad de bits de los datos de audio utilizando una interfaz de codificacion sin fases (proceso de manipulacion) para una formalizacion de composicion de sonido MSML, en donde la interfaz esta configurada para considerar una jerarqufa del valor de informacion perceptiva. El metodo de reduccion del ancho de banda y la tasa de bits utiliza la interfaz para realizar tareas dirigidas a la reduccion de datos seleccionados, al tiempo que conserva la informatividad o el valor de informacion de todas las estructuras de sonido asociadas con la composicion del sonido, por ejemplo, a traves de la comparacion con metricas de sonido conocidas. Tal metodo realiza una comparacion de objetos de sonido de diferente nivel en el espacio, centrandose en determinar la integridad de las estructuras y el grado de degradacion de las mismas, dentro de una representacion de cantidad reducida de la senal despues de la filtracion o la aplicacion de un proceso de manipulacion, lo que facilita la seleccion de un parametro adecuado para cada elemento de sonido. La interfaz de codificacion sin fases esta configurada de manera apropiada de tal forma que la dependencia del tiempo de la senal no se conserve, y las estructuras de sonido se conserven en lugar de la forma de onda de la senal, dando como resultado de este modo una disminucion del ancho de banda esencial y la tasa de bits. Para lograr una mayor velocidad de ancho de banda de audio y reduccion de la tasa de bits, las estructuras de nivel relativamente mas informativas de la formalizacion de composicion de sonido MSML estan configuradas para mantener parametros constantes. Los parametros de las estructuras de nivel relativamente menos informativas se guardan con menos precision o se generan durante la decodificacion con el uso de valores aleatorios.
De acuerdo con otro aspecto, pueden proporcionarse sistemas y metodos para el analisis de la estructura de datos de audio, utilizando una interfaz de analisis de estructura para una formalizacion de composicion de sonido MSML, para la extraccion de elementos repetitivos difusos de dichas composiciones musicales. Tal interfaz de analisis de estructura esta configurada para procesar datos de audio recibidos de la formalizacion MSML de la senal original e identificar elementos de bucle repetitivos difusos dentro de un nivel relativamente bajo de la formalizacion MSML, para su uso en una mayor reduccion de datos y sin disminuir la informatividad general de la senal. Tal interfaz comprende tres modulos. El primer modulo proporciona la busqueda, el posicionamiento y el marcado de longitud de todos los elementos repetitivos difusos a lo largo de todo el nivel inicial de la formalizacion MSML. El segundo modulo extrae un componente de sonido general para cualquier conjunto de fragmentos repetitivos difusos y define el nivel de cohesividad de los datos formando una senal residual correspondiente. El tercer modulo realiza una construccion predictiva del fragmento de audio resultante integrando los elementos repetitivos extrafdos, los datos de marcado correspondientes y la informacion residual. Se utiliza un metodo de filtrado para el modelado de fases para minimizar la informacion de la fase inicial requerida durante el proceso de construccion de sonido. Esta interfaz esta configurada para ser utilizada como un elemento para una diversidad de aplicaciones, incluyendo, pero sin limitacion, motores de busqueda de musica, visualizacion de musica, y tecnologfas de compresion profunda de audio.
Otro aspecto esta dirigido a sistemas y metodos para la compresion de audio utilizando estructuras repetitivas de jerarqufa en una formalizacion de composicion de sonido MSMl . La interfaz de codificacion de repeticion sin fases avanzada utiliza estructuras formadas por primotrones de sonido de macro-repeticion del nivel superior dentro de una jerarqufa de sonido de formalizacion MSML significativa. Se utilizan dos tipos de datos para el proceso de decodificacion: datos a gran escala que definen la estructura general dentro de la formalizacion MSML y datos que comprenden fragmentos de senales originales descritos por un modelo de nivel relativamente inferior. Para comprimir los fragmentos de senal, se puede utilizar un codificador psicoacustico general, en algunos casos, posiblemente utilizando un enmascaramiento de senal externo. La reduccion de la velocidad de bits se produce debido a la eliminacion de fragmentos repetitivos construidos en el nivel superior de formalizacion MSML, mientras se almacenan las ubicaciones de estos fragmentos. La equivalencia perceptiva de fragmentos repetitivos permite una reduccion en el numero de muestras de referencia.
Otro aspecto mas esta dirigido a los sistemas y metodos para la reduccion del ancho de banda de audio y la tasa de bits utilizando una interfaz de compresion sin perdida para una formalizacion de composicion de sonido MSML al reducir el numero de matrices de valores enteros asociadas con la misma a traves del uso de un codificador de entropfa avanzado que realiza solo operaciones enteras, sin divisiones, y estimaciones de probabilidad secundarias. Dado que el codificador de rango y el modelo contextual de la interfaz no utilizan la operacion matematica de division, permite la aplicacion de esta interfaz a/la ejecucion de la interfaz mediante microordenadores de bajo coste que no tienen una operacion de division. Para mejorar la fiabilidad del modelo contextual de la interfaz, se emplea una estimacion de probabilidad secundaria. La estimacion de probabilidad secundaria es un modelo contextual complejo que utiliza la probabilidad predicha como un contexto con respecto a otro modelo. La estimacion de probabilidad secundaria bidimensional tambien se puede utilizar para mezclar dos modelos diferentes. La estimacion de probabilidad secundaria bidimensional es una modificacion de la estimacion de probabilidad secundaria, que tiene dos probabilidades de entrada y las utiliza como contexto. Tambien se pueden utilizar contextos enteros adicionales.
Otro aspecto mas esta dirigido a sistemas y metodos para mejorar la compresion de senales de audio. Tambien se proporcionan sistemas y metodos para mejorar la codificacion aritmetica y el modelado contextual para aumentar las relaciones de compresion y las velocidades de procesamiento, y asf permitir que los datos espectrales se compriman con alta eficacia y mayor velocidad. El metodo de compresion puede ser completamente automatizado y no requiere inicializacion previa para diferentes tipos de datos de audio. Es lo suficientemente flexible para ajustarse a diferentes tamanos de datos de audio espectral, lo que permite su uso con diferentes transformaciones espectrales. En lugar de un codificador aritmetico estandar, se utiliza un codificador de rango mas eficiente. El modelado de contexto se aplica al flujo de datos, los modelos algontmicos construidos y la optimizacion algontmica de una funcion de codificador y/o de decodificador. Este aspecto tambien se basa, al menos parcialmente, en el uso de tecnicas de codificador de rango adaptativo que implican aumentar la probabilidad del valor codificado. Para mejorar la fiabilidad del modelo contextual, se puede emplear una estimacion de probabilidad secundaria.
Otros aspectos incluyen sistemas y metodos para la transmision eficiente de datos de audio utilizando una interfaz de acelerador avanzado de datos de audio para una formalizacion de composicion de sonido MSML, y utilizando un proceso de perdida de calidad nula (NQL) para reducir el numero de coeficientes espectrales de tiempo-frecuencia cuantificados (QMDCT), para proporcionar una entrega mas rapida del audio original sin una degradacion esencial de la calidad en el sonido resultante. El proceso NQL realiza una clasificacion de las estructuras de sonido dentro de la formalizacion MSML dependiendo de su importancia en funcion de los lfmites de la percepcion humana. La avanzada interfaz del acelerador reconstituye los coeficientes espectrales cuantificados de tiempo-frecuencia del formato inicial, sin la descuantificacion de los datos ni la transcodificacion inversa a traves del formato PCM. La avanzada interfaz del acelerador divide el archivo codificado inicialmente de coeficientes espectrales de tiempofrecuencia en tres grupos, donde los coeficientes de un grupo espectral de baja frecuencia permanecen inalterados, mientras que algunos coeficientes de un grupo de frecuencia intermedia se ponen a cero utilizando el proceso NQL, y los coeficientes del tercer grupo (frecuencias mas altas) se eliminan reemplazandolos con los subgrupos de coeficientes mas similares, uniendolos en grupos bajos e intermedios, y ahorrando una referencia a este subgrupo, asf como factores integrales, sin afectar a los elementos de sonido estructurales (es decir, armonicos y aciertos).
Tambien se proporcionan sistemas y metodos, de acuerdo con otro aspecto mas, para reducir el tamano de los datos de audio, utilizando una interfaz de codificacion de transformadas afines para una formalizacion de composicion de sonido MSML, mientras se conserva la integridad total de la reproduccion de sonido original en forma de transformada afm de los primotrones de sonido similares, lo que conduce a una disminucion en la entropfa de la senal (es decir, una estructuracion mas alta). La interfaz afm asociada con la formalizacion MSML se usa como una adicion o complemento de cualquier procedimiento de codificacion de audio para aumentar la relacion de compresion, asf como el proceso de compresion del nucleo, para la clase de senales donde los microfragmentos similares afines de tiempo-frecuencia contienen una parte esencial de la informacion de sonido. Esta interfaz de codificacion de transformadas afines, mientras que se utiliza junto con la formalizacion MSML, esta configurada para utilizar microfragmentos espectrales similares de la senal de audio digital para aumentar la relacion de compresion de la senal. Durante el procesamiento, el rango espectral completo se divide en sub-bandas. Se realiza una busqueda de fragmentos espectrales similares en la parte anterior de la senal de sonido de forma independiente y utilizando una etapa diferente en cada sub-banda. Se usa una transformada afm de cambio de amplitud, tiempo y espectral durante la busqueda de fragmentos similares. Cada fragmento encontrado se resta del fragmento espectral original y el residuo se procesa adicionalmente como una diferencia de componentes espectrales, eliminando de este modo una redundancia significativa de los datos espectrales.
En resumen, los aspectos de la presente descripcion proporcionan sistemas y metodos dirigidos a una formulacion de multiples niveles y estructura multiple de un sonido u otra composicion de medios digitales, asf como diversos sistemas y metodos para determinar un patron y/o combinacion de objetos primarios o entidades en la formalizacion para proporcionar un tamano del archivo de datos reducido en comparacion con el archivo de audio digitalizado original (es decir, una cantidad reducida de informacion o tasa de bits), al mismo tiempo que se conserva la maxima informatividad (es decir, la calidad de la informacion) de los elementos determinados, y sistemas y metodos para reconstruir o decodificar el patron/combinacion de objetos primarios o entidades (elementos) para sintetizar el sonido original u otra composicion de medios digitales. Por lo tanto, los aspectos de la presente descripcion abordan las necesidades identificadas y proporcionan otras ventajas como se detallada de otro modo en el presente documento.
BREVE DESCRIPCION DE LAS VARIAS VISTAS DE LOS DIBUJOS
Habiendo descrito asf la descripcion en terminos generales, ahora se hara referencia a los dibujos adjuntos, que no estan necesariamente dibujados a escala, y en los que:
La Figura 1 ilustra esquematicamente una formalizacion multinivel y multiestructura de datos de audio digital, como un ejemplo de estructuracion de informacion de acuerdo con diversos aspectos de la presente descripcion;
Las Figuras 2A - 2C ilustran esquematicamente una visualizacion de primotrones de informacion de sonido informativos correspondientes a una formalizacion MSML de un archivo de audio digital, como un ejemplo de estructuracion de informacion de acuerdo con diversos aspectos de la presente descripcion;
La Figura 3A ilustra esquematicamente un proceso de manipulacion para la codificacion sin fases de datos de audio digital, como un ejemplo de estructuracion de informacion de acuerdo con diversos aspectos de la presente descripcion;
La Figura 3B ilustra esquematicamente un proceso de manipulacion para la decodificacion sin fases de datos de audio digital, como un ejemplo de estructuracion de informacion de acuerdo con diversos aspectos de la presente descripcion;
La Figura 4A ilustra esquematicamente un proceso de manipulacion para descomponer una composicion musical en una parte residual y una parte repetitiva (es decir, extraer elementos repetitivos difusos), basados en 3 senales "base" iguales, como un ejemplo de estructuracion de informacion de acuerdo con diversos aspectos de la presente descripcion;
La Figura 4b ilustra esquematicamente un proceso de manipulacion para descomponer una composicion musical para extraer elementos repetitivos difusos, como un ejemplo de estructuracion de informacion de acuerdo con diversos aspectos de la presente descripcion;
La Figura 5 ilustra esquematicamente un proceso de manipulacion para la compresion de audio utilizando estructuras repetitivas de jerarqufa, como un ejemplo de estructuracion de informacion de acuerdo con diversos aspectos de la presente descripcion;
La Figura 6A ilustra esquematicamente un proceso de manipulacion para la compresion sin perdida utilizando un modelo contextual que implica un metodo de mezcla de probabilidad, como un ejemplo de estructuracion de informacion de acuerdo con diversos aspectos de la presente descripcion;
La Figura 6B ilustra esquematicamente un proceso de manipulacion para la compresion sin perdida utilizando un metodo de estimacion de probabilidad secundario, como un ejemplo de estructuracion de informacion de acuerdo con diversos aspectos de la presente descripcion;
La Figura 7A ilustra esquematicamente un proceso de manipulacion para una transmision eficiente de datos de audio utilizando un esquema de compresion con perdida que implica un acelerador de datos de audio y un proceso de perdida de calidad nula (NQL) para reducir el numero de coeficientes espectrales de tiempo-frecuencia cuantificados (QMDCT), como un ejemplo de estructuracion de informacion de acuerdo con diversos aspectos de la presente descripcion;
La Figura 7B ilustra esquematicamente los fragmentos de coeficiente QMDCT que son resultado de un proceso de manipulacion que implica un esquema de compresion con perdida, como un ejemplo de estructuracion de informacion de acuerdo con diversos aspectos de la presente descripcion;
La Figura 8A ilustra esquematicamente un esquema de codificacion de un proceso de manipulacion de codificacion de transformadas afines, como un ejemplo de estructuracion de informacion de acuerdo con diversos aspectos de la presente descripcion;
La Figura 8b ilustra esquematicamente un esquema de decodificacion de un proceso de manipulacion de codificacion de transformadas afines, como un ejemplo de estructuracion de informacion de acuerdo con diversos aspectos de la presente descripcion;
La Figura 8C ilustra esquematicamente un esquema de decodificacion rapida de un proceso de manipulacion de codificacion de transformadas afines, como un ejemplo de estructuracion de informacion de acuerdo con diversos aspectos de la presente descripcion;
La Figura 9 ilustra esquematicamente cambios en los datos entre los niveles de una formalizacion MSML de un archivo de informacion digital y procesos particulares de codificacion y decodificacion asociados con el mismo, como un ejemplo de estructuracion de informacion de acuerdo con varios aspectos de la presente descripcion;
La Figura 10 ilustra esquematicamente cambios en los datos entre los niveles de una formalizacion MSML de un archivo de audio digital y procesos particulares de codificacion y decodificacion asociados con el mismo, como un ejemplo de estructuracion de informacion de acuerdo con varios aspectos de la presente descripcion; y
La Figura 11 ilustra esquematicamente los procesos aplicados a los datos entre los niveles de una formalizacion MSML de un archivo de informacion digital, como un ejemplo de estructuracion de informacion de acuerdo con varios aspectos de la presente descripcion.
DESCRIPCION DETALLADA DE LA DESCRIPCION
La presente descripcion se describira ahora mas detalladamente en lo sucesivo en el presente documento con referencia a los dibujos adjuntos, en los que se muestran algunos, pero no todos, los aspectos de la descripcion. De hecho, la descripcion puede realizarse de muchas formas diferentes y no debe interpretarse como limitada a los aspectos expuestos en el presente documento; mas bien, estos aspectos se proporcionan para que esta descripcion satisfaga los requisitos legales aplicables. Los numeros similares se refieren a elementos similares en todo el documento.
Varias teorfas principales contemporaneas de ciertos fenomenos se basan en principios de optimalidad relativamente sencillos formulados en una sola frase. Sin embargo, llegar a dichas formulaciones sencillas generalmente requiere una evolucion significativa y lenta con respecto a la teorfa subyacente. Por ejemplo, la optica geometrica se basa en el principio de un mfnimo de movimiento a lo largo del haz de luz, la mecanica explota el principio de un mfnimo de accion, la termodinamica se basa en el principio de un maximo de entropfa, la teorfa de la evolucion se basa en el principio de supervivencia de las especies mas adaptadas, y la biologfa implementa el principio de un mfnimo de energfa. Los aspectos de la presente descripcion, concretamente, los aspectos dirigidos a una teorfa de formalizacion de sonido (basada en una disposicion de estructura multiple/nivel multiple (MSML)), como se describe, generalmente se basan y se dirigen al principio de maximizacion de la informatividad con respecto al tamano del archivo de datos, en donde, en aspectos particulares, tal principio se extiende a la maximizacion de la informatividad o el valor de informacion de los elementos de datos junto con la minimizacion del tamano del archivo de datos.
Como premisa inicial, puede darse el caso de que la cantidad de informacion incluida dentro de las ondas de sonido enviadas a los ofdos humanos sea apreciablemente mayor que la que recibe o se perciba de otro modo por el cerebro humano. Como tal, determinar y cuantificar de manera sucinta el alcance de la informacion que recibe y puede ser percibida por el cerebro humano puede ayudar a facilitar un esquema de formalizacion de sonido que se corresponda mas estrechamente con el mecanismo de percepcion humana para el sonido/audio, que puede estar entre los mas eficientes dentro de un sistema vivo. Por consiguiente, los aspectos de los esquemas de formalizacion MSML presentados en el presente documento pueden abordar los problemas mencionados anteriormente y pueden servir para crear una base de formalizacion universal para representar el sonido, tanto con respecto al habla como a la musica (es decir, el audio).
Cuando se presenta con un evento de audio de espectro completo, puede darse el caso de que al menos una parte de la informacion de audio se rechace a nivel fisiologico de la estructura del ofdo humano. Es decir, la fisiologfa del ofdo humano puede tener limitaciones que no facilitan la recepcion de toda la informacion de audio (es decir, limitaciones de frecuencia). Sin embargo, de la parte de la informacion de audio que recibe la fisiologfa del ofdo humano, la red de neuronas humanas asociada con el ofdo humano es responsable entonces de extraer y seleccionar naturalmente los objetos de sonido mas significativos de la informacion de audio restante. En esos casos, los objetos de sonido extrafdos y seleccionados pueden caracterizarse por datos especfficos locales al evento de audio, asf como, y posiblemente incluso principalmente, por estructuras de sonido mas globales y generalizadas.
A este respecto, los aspectos de la presente descripcion se dirigen a tales estructuras de sonido globales/generalizadas que pueden asociarse generalmente con la percepcion humana del sonido/audio. En algunos casos, dichas estructuras de sonido pueden tener una premisa adicional o estar asociadas con, por ejemplo, tres niveles de perdida de calidad nula (NQL), en donde estos niveles pueden depender, por ejemplo, de un momento de percepcion indistinguible de la informacion recibida. Mas particularmente, los tres niveles de NQL pueden caracterizarse de la siguiente manera:
1. Eventos de sonido indistinguibles perceptiblemente si un evento de sonido esta, por ejemplo, separado en aproximadamente 20 ms de duracion en el tiempo de otro evento de sonido.
Para tales eventos de sonido, la NQL puede satisfacerse solo si ambos eventos de sonido tienen formas de onda equivalentes. Los modelos de representacion de sonido que cumplen con este criterio se utilizan generalmente en codecs de audio estandar o convencionales. Sin embargo, una formalizacion MSML basada en esta escala/duracion de tiempo puede incluir un numero sustancial o una proporcion de estructuras o elementos MSML de baja informacion. Como tal, un codec asociado con una formalizacion MSML que se basa unicamente en tal criterio puede no ser capaz de maximizar o ni siquiera conservar la informatividad o calidad necesarias de las estructuras o elementos MSML, particularmente, por ejemplo, a bajas tasas de bits (o poca cantidad de informacion).
2. Eventos de sonido indistinguibles perceptiblemente si un evento de sonido esta, por ejemplo, separado en aproximadamente 1 min de duracion en el tiempo de otro evento de sonido.
En esta escala/duracion de tiempo, el requisito de equivalencia matematica (es decir, formas de onda equivalentes) no es necesario, y las caracterfsticas de percepcion de los eventos de sonido se definen por estructuras o elementos MSML comparativamente mucho menos esenciales, ya que una cantidad relativamente menor de informacion sobre el evento de sonido inicial escuchado/experimentado previamente permanece en o asociada con el cerebro. Sin embargo, se puede realizar un analisis de sonido mas complejo para determinar si las estructuras o elementos asociados con el segundo nivel o niveles superiores de formalizacion MSML pueden tener calidad suficiente, aunque la correspondencia exacta puede no ser necesaria para lograr la equivalencia de percepcion.
3. Eventos de sonido perceptivamente equivalentes si un evento de sonido esta, por ejemplo, separado en aproximadamente 1 dia o mas de duracion en el tiempo de otro evento de sonido.
En este periodo/duracion de tiempo, el cerebro humano generalmente retiene solo estructuras de informacion de sonido altamente concentradas, que generalmente representan/corresponden a niveles superiores del esquema de formalizacion MSML. Dichas estructuras desempenan un papel importante en los aspectos del analisis de sonido presentados en el presente documento y son importantes para la equivalencia perceptiva, aunque la cantidad de informacion/informatividad de las estructuras/elementos es relativamente menor que en el periodo/duracion de tiempo anterior. Generalmente, los profesionales de audio cualificados pueden distinguir la estructura de sonido de nivel inferior (es decir, asociados con los periodos de tiempo/duraciones mas cortas anteriores, incluso en largos periodos de tiempo entre eventos de sonido, aunque la transicion/progresion de estructuras de sonido de nivel inferior a superior (es decir, desde el periodo de tiempo/duracion mas corta hasta el periodo de tiempo/duracion mas larga) es generalmente el proceso comun para la mayorfa de las personas que experimentan los eventos de sonido.
De acuerdo con la teorfa ffsica, en un sistema que tiene varios estados permisibles en ciertas condiciones, cuanto mas ordenado esta el sistema, menos entropfa esta presente. Ademas, a partir de la segunda ley de la termodinamica, la entropfa generalmente aumenta en sistemas aislados. Sin embargo, de acuerdo con Schroedinger, una persona se esfuerza continuamente por reducir la entropfa en las experiencias de la vida con el fin de apoyar la organizacion interna, o de otro modo para guardar informacion estructurada. El concepto de entropfa tambien puede equipararse a veces con la cantidad de informacion, asf como con la propia informacion, al menos en parte debido a la falta de una determinacion cientffica de la informacion y numerosas definiciones de la informacion. De acuerdo con Shannon, la cantidad de informacion es inversamente proporcional a la entropfa. Es decir, cuanto menos probable es el evento (mas entropfa), menos informacion se incluye en los datos sobre ese evento. De otro modo, la cantidad de informacion puede representarse como un cambio cuantitativo en la incertidumbre como resultado de la comunicacion. Sin embargo, la cantidad de informacion es solo un atributo de dicha informacion (que puede tener muchos atributos diferentes), y el valor de la informacion puede ser el mas importante de esos otros atributos. En cualquier caso, a partir de muchas definiciones de informacion, los aspectos de la presente descripcion pueden basarse en una dada por Casteler: "la informacion es una eleccion memorizada de una serie de posibles elecciones".
De acuerdo con Chernavsky, la macroinformacion es una eleccion memorizada, concretamente, la duracion en el tiempo de la existencia del conocimiento que es mayor que la duracion en el tiempo del uso de la informacion dada asociada con ese conocimiento. La microinformacion es una eleccion no memorizada de un aspecto de una serie de aspectos posibles. El alcance de la entropfa ffsica (o la entropfa de Boltzman) se limita a los sistemas ergodicos que olvidan rapidamente su estado anterior (por lo tanto, en gas este tiempo es de aproximadamente 10' 13 s a una temperatura de ~300 K). A este respecto, la cantidad de macroinformacion es proporcional al logaritmo de una cantidad de estados estacionarios, y la microinformacion es proporcional al logaritmo de una cantidad de todos los estados, no necesariamente estados estacionarios. Por ejemplo, la cantidad de microinformacion en un recipiente lleno de gas es:
Imicro = log2 (el numero de todos los estados) = log2(exp(S/k)), donde S es la entropfa igual a 3/2kN (es decir, la informacion es 2,16*N, que es comparable a la constante de Avogadro en el orden de 1023)
Imacro = log2 (el numero de estados estacionarios) = log2(1) = 0 (ya que solo hay un estado estacionario, es decir, el equilibrio termodinamico).
Por lo tanto, el concepto de contenido de informacion depende de si esa informacion se puede o no usar. Mas particularmente, el ruido blanco en un sonido puede considerarse el equivalente del equilibrio termodinamico, ya que ambos estados corresponden al de maxima entropfa del sistema respectivo. Se puede extraer un corolario con respecto a un recipiente lleno de gas, concretamente, donde la macroinformacion es minima e igual a cero, mientras que la microinformacion es maxima.
De acuerdo con un aspecto, el valor de la informacion se puede definir como la diferencia entre la entropfa del sistema con y sin el efecto de la informacion recibida. Matematicamente, dicho valor de informacion se puede definir como: V = log2(P1/P0), donde P0 es la probabilidad de cumplir el proposito sin la recepcion de informacion, y P1 es la probabilidad de cumplir el proposito con la informacion recibida, aunque la nocion de proposito puede ser diferente para el sistema de captura. En este sentido, el proposito de cada elemento es almacenar (conservar) la informacion asociada con el mismo. Una vez que se indique o se defina de otro modo el proposito, se puede hacer un seguimiento y analizar la evolucion del valor de la informacion obtenida asociada con ese proposito. Por consiguiente, los aspectos de la presente descripcion incluyen el proposito de analizar y extraer primotrones de audio digitalizado como base para el esquema de sfntesis de sonido. Un experto en la tecnica apreciara, sin embargo, que la referencia en el presente documento a sonido o audio es simplemente una ilustracion ejemplar de la aplicabilidad y capacidades de los sistemas y metodos descritos en el presente documento, y que los sistemas y metodos descritos en el presente documento pueden ser mas generalmente aplicables a cualquier informacion capaz de analizarse en forma digital tal como, por ejemplo, medios digitales que incluyen audio, video y similares.
Por lo tanto, los aspectos de la descripcion pueden proporcionar, por ejemplo, sistemas y metodos para el analisis, identificacion y estructuracion de primotrones (es decir, elementos o estructuras de datos representativos primarios) organizados entre diferentes niveles de la jerarquia MSML, y asociados con los archivos de audio digital u otro archivo multimedia digital convertible a un formato MSML. Ademas, dichos sistemas y metodos de analisis, identificacion y estructuracion pueden ser diferentes de la sfntesis o reconstruccion del audio u otros medios digitales dentro de un umbral de los medios digitales originales, a partir de dichos primotrones. Es decir, la codificacion del archivo multimedia digital original puede ser un proceso diferente a la decodificacion del archivo codificado para sintetizar o reconstruir el archivo multimedia digital original. En cualquier caso, el enfoque general de aspectos particulares de la presente descripcion dirigida a la descripcion o representacion del sonido u otro medio basandose en primotrones puede permitir la representacion (es decir, la determinacion de las combinaciones de elementos de datos que forman los primotrones) y la sfntesis ("reconstruccion") de los primotrones para formar un sonido u otro archivo multimedia puede basarse en las interacciones de las interfaces (tambien referidas en el presente documento como "procesos de manipulacion") con la formalizacion MSML, en donde dichos procesos de manipulacion pueden ser independientemente funcionales o cooperativos para una funcion particular o en casos particulares. Dado que la naturaleza del sonido (especialmente la musica y el habla), pero tambien en cierta medida otros medios tal como video, puede basarse en la repetitividad particular del sonido basico u otros elementos basicos (es decir, letras individuales, ortograffa de palabras, sfmbolos de melodfa, armonicos), entonces los primotrones particulares o combinaciones de los mismos, se pueden usar como una representacion compacta del archivo procesado por MSML en terminos de disposicion de estos elementos basicos o primarios identificados de una manera altamente estructurada (en donde los datos estructurados pueden tener asociados con los mismos parametros caoticos particulares que pueden facilitar la interpretacion de los datos, asf como la estructura de los mismos) que reduce la cantidad de informacion, por ejemplo, reduciendo o minimizando la redundancia de estos elementos, garantizando al mismo tiempo que estos elementos basicos estructurados conservan dentro de un umbral perceptivo tanto o mas del valor de la informacion que el archivo original. Ademas, de esta manera, diferentes niveles de primotrones o elementos de datos en la jerarquia MSML pueden servir como semilla o semillas a partir de las cuales la senal general (es decir, el archivo de audio digitalizado original) se puede sintetizar o restaurar de otra manera, si las instrucciones o reglas correspondientes para dicha sfntesis se definen, por ejemplo, a traves de los parametros caoticos o de otra manera adecuada (es decir, que implica una evaluacion estadfstica de las probabilidades de reconstruccion).
Como tal, en la revision, los aspectos de la presente descripcion proporcionan metodos de procesamiento de audio u otros medios digitales dirigidos a formar una formalizacion digital compacta multiestructural, multinivel (MSML) de tal sonido u otros medios (veanse, por ejemplo, las Figuras 1, 9, 10 y 11), donde dichos metodos se basan en definiciones particulares de un primotron de informacion, criterios de informacion perceptiva (PIC) asociados con la existencia de dichos primotrones (es decir, asociados con los lfmites de la percepcion humana), y la determinacion de combinaciones o conjuntos de elementos de datos que forman dichos primotrones. Dicha formalizacion MSML tambien puede involucrar metodos de extraccion y clasificacion de primotrones de audio digital u otros archivos multimedia digitales en los dominios tanto del tiempo como de tiempo-frecuencia. Tambien asociada con los procedimientos de formalizacion MSML como se describe en el presente documento puede estar la definicion de un nivel secundario o conjunto de estructuras de sonido MSML y los PIC asociados con las mismas, que tambien puede implicar al menos algun analisis de primotron para construir tales estructuras MSML secundarias. Los procedimientos de formalizacion MSML tambien pueden asociarse con la definicion de un alto nivel o conjunto de estructuras de sonido MSML y los PIC asociados con las mismas en la jerarquia, lo que tambien puede implicar el analisis de estructuras MSML de nivel inferior para seleccionar o definir de otro modo estructuras MSML de nivel superior particulares. Estos principios y metodos cooperan para permitir la construccion de un modelo estructural parametrico de sonido u otro medio con el proposito de formalizarlo, particularmente la formalizacion MSML que se describe en el presente documento, que puede promover y facilitar la organizacion de los datos en estructuras y conjuntos de estructuras particulares. Tambien se pueden asociar con los procedimientos de formalizacion MSML los metodos y aparatos para establecer una biblioteca de primotrones de dominio del tiempo-frecuencia que se puede usar para la sfntesis o reconstruction de sonido, donde la disposition o disposiciones de primotrones particulares dentro de la biblioteca pueden definirse por las estructuras de niveles superiores de la formalization MSML.
Los aspectos de la presente description tambien proporcionan metodos para determinar dichos criterios de information perceptiva (PIC) para definir las probabilidades de existencia del primotron realizando una comparacion de dos valores de energfa, en donde se puede determinar un valor de energfa para una estructura forma o esta asociada de otro modo con un primotron, y en donde el segundo valor de energfa puede calcularse para una fraction de una senal digital, dentro del dominio del tiempo-frecuencia, que incluye el primotron senalado. Si la relation entre el primer valor de energfa con respecto al segundo valor de energfa es mayor que un valor de umbral predeterminado, entonces se cumplen los PIC para el primotron senalado, afirmando la existencia de los mismos.
Otro aspecto de la presente description esta dirigido a un metodo para definir un valor de energfa de umbral como una probabilidad aceptable de un evento en el que la fluctuation aleatoria del caos se puede reconocer como una estructura de sonido valiosa, en donde tal probabilidad se puede determinar realizando un experimento computational o mediante la aplicacion directa de una formula derivada teoricamente para definir una funcion de distribution de probabilidad utilizando ruido aleatorio como senal de entrada.
Otro aspecto mas de la presente description se dirige a una formulation teorica de una definition de valor de umbral de energfa de primotron a traves de un proceso que incluye el calculo del area superficial de la esfera n-dimensional (Sn) de un radio de unidad unica en un dominio del tiem o-frecuencia, utilizando la si uiente funcion implfcita:
Figure imgf000011_0001
donde K es el umbral de energfa objetivo de los primeros M componentes de un vector N dimensional dividido por la energfa total del vector. Los indices en los terminos de suma incluyen los valores 21+2q-N+2 = 0 y
Figure imgf000011_0002
de manera que:
Sn se determina como:
Figure imgf000011_0003
Otro aspecto mas de la presente description esta dirigido a un metodo para definir un criterio de perdida de calidad nula (NQL) mediante analisis comparativo entre una senal original y una senal sintetizada o restaurada de otro modo de acuerdo con los procedimientos de formalization MSML descritos en el presente documento.
Otro aspecto mas de la presente description esta dirigido a un metodo para definir un PIC como un factor de probabilidad para construir una nueva estructura de nivel superior de la jerarqufa de formalization MSML, solo cuando el establecimiento o el origen de tal estructura de nivel superior disminuye la entropfa general de las estructuras de nivel inferior de la formalization MSML que cooperan para formar la estructura de nivel superior.
Un aspecto adicional de la presente description esta dirigido a un metodo para determinar o designar una estructura de primotron como un numero de primotrones correspondientes u otros elementos de datos dentro del primer nivel de la jerarqufa MSML de acuerdo con la coordenada de tiempo asociada con la misma dentro del dominio del tiempo. Ademas, tal aspecto tambien puede incluir la definition de un acierto como primotrones de segundo nivel localizados en el tiempo, estructuras de primotron, u otros elementos de datos que tengan las mismas coordenadas de inicio en el tiempo, en donde se proporciona una disminucion de la entropfa en una estructura de nivel superior (es decir, una description mas concisa) al eliminar la redundancia de los valores de componente de tiempo de primotron aparentes en la estructura de nivel inferior. Un aspecto de este tipo tambien puede incluir la definition de armonicos como estructuras MSML de segundo nivel localizadas en la frecuencia, en donde un inicio o encuentro de primotron posterior coincide con la coordenada final de primotron anterior. En tales casos, la disminucion de la entropfa para una estructura de nivel superior tambien se proporciona al eliminar la redundancia de los valores de los componentes de tiempo de primotron. Tal aspecto puede incluir ademas la definition de un conjunto de sobretonos como estructuras MSML de segundo nivel localizadas en la frecuencia que incluyen una frecuencia base unica de las estructuras MSML de primer nivel y una cantidad de copias de las mismas desplazadas por un valor de frecuencia fija desde la frecuencia base y entre sf La entropfa general de tales estructuras puede tender a disminuir como resultado de una descripcion compacta del conjunto de estructuras de primer nivel en un solo parametro asociado con el cambio de frecuencia.
Mas particularmente, cuando el archivo de informacion digital original es un archivo de audio digital, tal aspecto de la presente descripcion implica asociar una cantidad de informacion del archivo de audio digital con una tasa de bits proporcional a un tamano y una duracion del archivo de audio digital, y asociar un valor de informacion del archivo de audio digital con una calidad del archivo de audio digital, en el que la calidad se determina a partir de al menos uno de un valor de umbral de energfa de primotron, un criterio de informacion perceptiva (PIC), una estructura de sonido identificada a partir de un evento de fluctuacion de caos aleatorio determinado de acuerdo con una funcion de distribucion de probabilidad que usa ruido aleatorio como senal de entrada, un criterio de perdida de calidad nula, y un area de superficie de una esfera n-dimensional de un radio de unidad unica en un dominio de tiempo-frecuencia determinado a partir de funcion implfcita.
En aspectos particulares, por ejemplo, en el caso de un archivo de audio digital como se muestra, por ejemplo, en las Figuras 2A-2C, las interfaces estructurantes o los procesos de manipulacion pueden aplicarse sucesivamente a un archivo de audio digital previamente resultante para formar un ultimo archivo de audio digital estructurado resultante configurado de acuerdo con una jerarqrna de informacion que tiene una pluralidad de niveles de informacion, en donde un nivel de informacion inferior en la jerarqrna comprende una representacion del audio como un archivo de informacion digital de alta resolucion, y un nivel de informacion superior en la jerarqrna comprende, por ejemplo, una representacion en ficha que incluye una puntuacion de nota escrita con las letras correspondientes. Cuando esta tan estructurado, el nivel de informacion superior puede tener una cantidad de informacion mas pequena que el nivel de informacion inferior en la jerarqrna, en donde el nivel de informacion inferior se puede formar, sintetizar o reconstruir a partir del nivel de informacion superior y los parametros caoticos asociados con el rendimiento y la digitalizacion del audio de acuerdo con la representacion en ficha.
Otro aspecto de la presente descripcion reconoce que la aplicacion sucesiva de procesos de manipulacion al archivo de audio digital previamente resultante forma el ultimo archivo de audio digital estructurado resultante, en donde el ultimo archivo de audio digital estructurado resultante comprende al menos un primotron definido en uno de un dominio del tiempo y un dominio del tiempo-frecuencia, y por lo tanto, representa una formalizacion digital compacta de una senal armonica, en donde la cantidad de informacion asociada con la tasa de bits de audio se reduce en comparacion con el archivo de audio digital correspondiente al archivo de informacion digital original, mientras que el valor de la informacion asociado con la calidad de audio se mantiene dentro de un umbral del archivo de audio digital correspondiente al archivo de informacion digital original.
Aun otro aspecto de la presente descripcion reconoce que cada archivo de audio digital representa datos relacionados con armonicos, y el analisis de los mismos implica la definicion de aciertos como estructuras jerarquicas de nivel superior en el dominio del tiempo; la definicion de armonicos como estructuras jerarquicas de nivel superior en el dominio de la frecuencia que tienen un origen de primotron armonico posterior que coincide con una terminacion de primotron armonico anterior; la eliminacion de la redundancia en las estructuras jerarquicas de nivel inferior de dominio del tiempo para obtener una disminucion de la entropfa en las estructuras jerarquicas de nivel superior; y la definicion de sobretonos como estructuras jerarquicas de nivel superior de dominio de la frecuencia que tienen una frecuencia base unica correspondiente a las estructuras jerarquicas de nivel inferior y una pluralidad de copias de las estructuras jerarquicas de nivel superior desplazadas una frecuencia fija de la frecuencia base unica y entre sf
En un sentido mas general, la formalizacion MSML puede referirse a un metodo de estructuracion de informacion, en el que dicha informacion puede comprender, por ejemplo, informacion digital tal como datos de audio, como se ha hecho referencia anteriormente y de otro modo en el presente documento. De este modo, primero se analiza un archivo de informacion digital original para determinar una cantidad de informacion original y un valor de informacion original asociado con la misma. Es decir, primero se determina cuantos elementos de datos se incluyen en el archivo de informacion digital, y el nivel asociado de informatividad asociado con cada uno de estos elementos de datos. En la estructuracion de la informacion, se puede aplicar un proceso de manipulacion inicial al archivo de informacion digital original para formar un primer archivo de informacion digital resultante, y aplicarse un proceso de manipulacion posterior al primer archivo de informacion digital resultante para formar un segundo archivo de informacion digital resultante. En tales casos, cada proceso de manipulacion puede configurarse para eliminar al menos un elemento del archivo de informacion digital procesado, en el que tal elemento eliminado puede, por ejemplo, identificarse como redundante, con ruido o, de otro modo, innecesario. En otros casos, cada proceso de manipulacion puede estar configurado para representar una combinacion de una pluralidad de elementos del archivo de informacion digital procesado con un elemento representativo y una primera indicacion asociada con una interrelacion entre el elemento representante y al menos uno de la pluralidad de elementos en la combinacion, a fin de reducir la cantidad de informacion y estructurar el archivo de informacion digital procesado. Es decir, los elementos pueden combinarse y representarse por un unico elemento representativo, en donde el unico elemento representativo puede tener asociado con el mismo una primera indicacion que indique, por ejemplo, una razon, un resultado de analisis, o cualquier otro indicador adecuado de por que los elementos particulares se combinaron y la naturaleza de la relacion entre esa combinacion particular de elementos y el elemento representativo designado (es decir, el elemento representativo representa que los elementos combinados forman un patron o melodfa repetida, definen un armonico, estan asociados con la letra, etc.). Al eliminar uno o mas elementos y/o combinar elementos, cada proceso de manipulacion puede configurarse de tal manera que al menos uno de los elementos eliminados y/o el elemento representativo se determine para reducir el valor de informacion del archivo de informacion digital procesado en no mas de un umbral seleccionado. Es decir, mientras que la cantidad de informacion previa puede reducirse, cada proceso de manipulacion se configura preferiblemente de modo que el valor de informacion del archivo de informacion digital resultante este dentro de una cantidad particular u otra medida adecuada del archivo de informacion digital original o anterior (es decir, dentro de un umbral particular). De esta manera, los procesos de manipulacion pueden aplicarse sucesivamente al archivo de informacion digital previamente resultante (es decir, para cada archivo de informacion digital resultante, pueden aplicarse al mismo otro proceso de manipulacion), hasta que las aplicaciones de proceso de manipulacion sucesivas no logran una reduccion de umbral en la cantidad de informacion en el archivo de informacion digital resultante posterior sobre el archivo de informacion digital previamente resultante. Es decir, el proceso de aplicar un proceso de manipulacion a cada archivo de informacion digital resultante puede continuar hasta que no haya una disminucion apreciable (es decir, dentro de un umbral) en la cantidad de informacion en un archivo de informacion digital resultante posterior sobre el archivo de informacion digital resultante anterior. En otras palabras, la aplicacion del ultimo proceso de manipulacion aplicada no da como resultado una eliminacion apreciable del elemento o elementos y/o una combinacion apreciable de elementos que estan representados por un elemento representativo. Como tal, el ultimo archivo de informacion digital resultante puede tener de este modo una estructura primaria con una cantidad de informacion reducida con respecto a la cantidad de informacion original y un valor de informacion resultante dentro del umbral seleccionado del valor de informacion original. Es decir, la cantidad de informacion incluida en el ultimo archivo de informacion digital resultante es menor que la cantidad de informacion en el archivo de informacion digital original, pero el valor de informacion o informatividad de los datos en el ultimo archivo de informacion digital resultante esta dentro de una cierta medida aceptable (es decir, dentro de un umbral) del archivo de informacion digital original (veanse, por ejemplo, las Figuras 9-11).
Durante el proceso de aplicar sucesivamente diversos procesos de manipulacion a cada archivo de informacion digital resultante, al menos el ultimo archivo de informacion digital estructurado resultante puede configurarse de acuerdo con una jerarqufa de informacion que tiene una pluralidad de niveles de informacion. Es decir, el ultimo archivo de informacion digital resultante incluye informacion relativamente altamente estructurada (en comparacion, por ejemplo, con el archivo de informacion digital original), en el que la cantidad de datos o informacion dentro del archivo es menor que el archivo de informacion digital original, pero el valor de esos datos o informacion se encuentra dentro de una cantidad o umbral particular del archivo de informacion digital original (es decir, un archivo mas pequeno en terminos de cantidad de datos, pero en el que el archivo tiene aproximadamente el mismo valor de informacion, o posiblemente mas). Ademas, al estar estructurado de este modo, el ultimo archivo de informacion digital resultante puede tener una configuracion jerarquica, en la que los datos en los niveles de informacion superiores de la jerarqufa pueden estar relacionados con los datos en los niveles inferiores de la jerarqufa por medio de diversos parametros caoticos. Es decir, un nivel de informacion superior de la jerarqufa de informacion puede incluir una cantidad de informacion mas pequena que un nivel de informacion inferior, en donde el nivel de informacion superior se forma a partir de una estructura (es decir, combinaciones de datos o combinaciones de elementos particulares) del nivel de informacion inferior y parametros caoticos (es decir, razones u otros parametros que conducen a la combinacion particular) asociados con el mismo. En algunos casos, el nivel de informacion superior puede formarse de tal manera que el nivel de informacion superior incluya un valor de informacion mas elevado que el valor de informacion original, por ejemplo, debido a la informacion asociada con los parametros caoticos. En algunos casos, si es necesario, se puede formar una pluralidad de niveles de informacion inferiores a partir de una estructura de un nivel de informacion superior, y al menos uno de la pluralidad de niveles de informacion inferiores puede seleccionarse para asociarse con ese nivel de informacion superior. En tales casos, la relacion entre los mismos puede definirse por parametros caoticos particulares.
En algunos aspectos, una pluralidad de procesos de manipulacion puede aplicarse simultaneamente a un archivo de informacion digital anterior para formar un archivo de informacion digital estructurado secundario, ademas del archivo de informacion digital estructurado primario. En tales aspectos, los archivos de informacion digital estructurados primarios y secundarios se pueden analizar para determinar al menos una de las interrelaciones entre los niveles de informacion dentro de uno de los archivos de informacion digital estructurados primarios y secundarios, y una interrelacion entre los archivos de informacion digital estructurados primarios y secundarios. Dichas interrelaciones pueden, en algunos casos, incluir o estar asociadas de otro modo con los parametros caoticos descritos previamente.
En algunos aspectos, al menos uno de una pluralidad de procesos de manipulacion pueden aplicarse a un archivo de informacion digital anterior, en el que los procesos de manipulacion pueden seleccionarse del grupo que consiste en, por ejemplo, un proceso de manipulacion de codificacion sin fases, un proceso de manipulacion de analisis estructurado para estructuras repetitivas, un proceso de manipulacion de codificacion de repeticion sin fases, un metodo de manipulacion de compresion de entropfa sin perdidas, un proceso de manipulacion de acelerador sin perdidas para formar una capa de compresion adicional para un archivo de datos de audio previamente reducido, un proceso de manipulacion de acelerador para facilitar la transmision eficiente de datos de audio, y un proceso de manipulacion de codificacion de transformada affn.
Mas particularmente, en un aspecto de un proceso de manipulacion, la reduccion del ancho de banda y de la tasa de bits de los datos de audio puede realizarse utilizando una interfaz de codificacion sin fases para una formalizacion de composicion de sonido MSML, en donde la interfaz esta configurada para considerar una jerarqufa de valores de informacion perceptiva (vease, por ejemplo, la Figura 3A). La reduccion del ancho de banda y de la tasa de bits se pueden lograr utilizando una interfaz de este tipo para realizar tareas dirigidas a la reduccion de datos seleccionados, al tiempo que se mantiene la informatividad de todas las estructuras de sonido asociadas con la composicion del sonido, por ejemplo, mediante el uso de metricas de sonido. De este modo, se realiza una comparacion de objetos de sonido de diferente nivel en el espacio, centrandose en determinar la integridad de las estructuras y el grado de dano en los mismos, dentro de una representacion reducida de la serial despues de la filtracion, lo que facilita la seleccion de un parametro adecuado para cada elemento de sonido. La interfaz de codificacion sin fases esta configurada de manera apropiada de tal forma que la dependencia del tiempo de la senal no se conserve, y las estructuras de sonido se conserven en lugar de la forma de onda de la senal, dando como resultado de este modo una disminucion del ancho de banda esencial y la tasa de bits. Para lograr una mayor velocidad de ancho de banda de audio y reduccion de la tasa de bits, las estructuras de nivel relativamente mas informativas de la formalizacion de composicion de sonido MSML estan configuradas para mantener parametros constantes. Los parametros de las estructuras de nivel relativamente menos informativas dentro de la jerarqufa se pueden guardar con menos precision o se generan durante la decodificacion con el uso de valores aleatorios, en donde se muestra un proceso de decodificacion ejemplar asociado con tal interfaz de codificacion sin fases, por ejemplo, en la Figura 3B.
De acuerdo con otro aspecto de un proceso de manipulacion, puede realizarse un analisis de la estructura de datos de audio, utilizando una interfaz de analisis de estructura para una formalizacion de composicion de sonido MSML, para la extraccion de elementos repetitivos difusos de dichas composiciones musicales como se muestra, por ejemplo, en las Figuras 4A y 4B. Tal interfaz de analisis de estructura puede configurarse para procesar datos de audio recibidos de la formalizacion MSML de la senal original e identificar elementos de bucle repetitivos difusos dentro de un nivel relativamente bajo de la formalizacion MSML, para su uso en una mayor reduccion de datos y sin disminuir la informatividad general de la senal. Tal interfaz puede comprender tres modulos, en la que el primer modulo puede proporcionar la busqueda, el posicionamiento y el marcado de longitud de todos los elementos repetitivos difusos a lo largo de todo el nivel inicial de la formalizacion MSML. El segundo modulo puede configurarse para extraer un componente de sonido general para cualquier conjunto de fragmentos repetitivos difusos y para definir el nivel de cohesividad de los datos formando una senal residual correspondiente. El tercer modulo puede configurarse para realizar una construccion predictiva del fragmento de audio resultante integrando los elementos repetitivos extrafdos, los datos de marcado correspondientes y la informacion residual. Puede aplicarse un metodo de filtrado para el modelado de fases para minimizar la informacion de la fase inicial requerida durante el proceso de construccion de sonido. Tal interfaz puede configurarse para ser utilizada como un elemento para una diversidad de aplicaciones, incluyendo, pero sin limitacion, por ejemplo, motores de busqueda de musica, visualizacion de musica, y tecnologfas de compresion profunda de audio.
Otro aspecto de un proceso de manipulacion implica la compresion de audio utilizando estructuras repetitivas de jerarqufa en una formalizacion de composicion de sonido MSML como se muestra, por ejemplo, en la Figura 5. Tal interfaz de codificacion de repeticion sin fases avanzada utiliza estructuras formadas por primotrones de sonido de macro-repeticion del nivel superior dentro de una jerarqufa de sonido de formalizacion MSML significativa. Se pueden utilizar dos tipos de datos para el proceso de decodificacion: datos a gran escala que definen la estructura general dentro de la formalizacion MSML y datos que comprenden fragmentos de senales originales descritos por un modelo de nivel relativamente inferior en la jerarqma. Para comprimir los fragmentos de senal, se puede utilizar un codificador psicoacustico general, en algunos casos, posiblemente utilizando un enmascaramiento de senal externo. La reduccion de la velocidad de bits se produce debido a la eliminacion de fragmentos repetitivos construidos en el nivel superior de formalizacion MSML, mientras se almacenan las ubicaciones de estos fragmentos. La equivalencia perceptiva de fragmentos repetitivos permite una reduccion en el numero de muestras de referencia.
Otro aspecto mas de un proceso de manipulacion implica la reduccion del ancho de banda de audio y de la tasa de bits utilizando una interfaz de compresion sin perdida para una formalizacion de composicion de sonido MSML (vease, por ejemplo, la Figura 6A) que, en algunos casos, reduce el numero de matrices de valores enteros asociado con la formalizacion de composicion de sonido MSML a traves del uso de un codificador de entropfa avanzado que realiza solo operaciones de enteros, sin divisiones y estimaciones de probabilidad secundarias. Dado que el codificador de rango y el modelo contextual de la interfaz no utilizan la operacion matematica de division, permite la aplicacion de tal interfaz a/la ejecucion de la interfaz mediante la mayor parte de microordenadores de bajo coste que no tienen una operacion de division. Para mejorar la fiabilidad del modelo contextual de la interfaz, puede emplearse una estimacion de probabilidad secundaria (vease, por ejemplo, la Figura 6B). La estimacion de probabilidad secundaria es un modelo contextual complejo que utiliza la probabilidad predicha como un contexto con respecto a otro modelo. La estimacion de probabilidad secundaria bidimensional tambien se puede utilizar para mezclar dos modelos diferentes. La estimacion de probabilidad secundaria bidimensional es una modificacion de la estimacion de probabilidad secundaria, que tiene dos probabilidades de entrada y las utiliza como contexto. Tambien se pueden utilizar contextos enteros adicionales. Tal aspecto de un proceso de manipulacion tambien puede implicar la compresion de senales de audio, y/o mejorar la codificacion aritmetica y el modelado contextual para aumentar las relaciones de compresion y las velocidades de procesamiento, y asf permitir que los datos espectrales se compriman con alta eficacia y mayor velocidad. El procedimiento de compresion puede ser completamente automatizado y no requiere necesariamente inicializacion previa para diferentes tipos de datos de audio u otros datos digitales. Puede ser lo suficientemente flexible para ajustarse a diferentes tamanos o cantidades de datos de audio espectral u otros datos digitales, lo que permite su uso con diferentes transformaciones espectrales. En lugar de un codificador aritmetico estandar, puede utilizar un codificador de rango mas eficiente. El modelado de contexto se aplica al flujo de datos, los modelos algontmicos construidos y la optimizacion algontmica de una funcion de decodificador. Este aspecto tambien puede basarse, al menos parcialmente, en el uso de tecnicas de codificador de rango adaptativo que implican aumentar la probabilidad del valor codificado. Para mejorar la fiabilidad del modelo contextual, se puede emplear una estimacion de probabilidad secundaria.
Otros aspectos de procesos de manipulacion implican la transmision eficiente de datos de audio utilizando una interfaz de acelerador avanzado de datos de audio para una formalizacion de composicion de sonido MSML, utilizando un proceso de perdida de calidad nula (NQL) para reducir el numero de coeficientes espectrales de tiempo-frecuencia cuantificados (QMDCT), para proporcionar una entrega mas rapida del audio original u otra informacion digital sin una degradacion esencial de la calidad en el sonido o datos resultantes (veanse, por ejemplo, las Figuras 7A y 7B). El proceso NQL realiza una clasificacion de las estructuras de sonido dentro de la formalizacion MSML dependiendo de su importancia en funcion de la percepcion humana. La avanzada interfaz del acelerador reconstituye los coeficientes espectrales cuantificados de tiempo-frecuencia del formato inicial, sin la descuantificacion de los datos ni la transcodificacion inversa a traves del formato PCM. Tal interfaz avanzada del acelerador divide el archivo codificado inicialmente de coeficientes espectrales de tiempo-frecuencia en tres grupos, donde los coeficientes de un grupo espectral de baja frecuencia permanecen inalterados, mientras que algunos coeficientes de un grupo de frecuencia intermedia se ponen a cero utilizando el proceso NQL, y los coeficientes del tercer grupo (frecuencias mas altas) se eliminan reemplazandolos con los subgrupos de coeficientes mas similares, uniendolos en grupos bajos e intermedios, y ahorrando una referencia a este subgrupo similar, asf como, por ejemplo, un factor integral asociado con el mismo, sin afectar a los elementos de sonido estructurales u otros elementos de datos digitales (es decir, armonicos y aciertos).
Otro aspecto mas de un proceso de manipulacion implica reducir el tamano o la cantidad del archivo de audio u otros datos digitales, utilizando una interfaz de codificacion de transformadas afines para una formalizacion de composicion de sonido MSML (vease, por ejemplo, la Figura 8A), mientras que (en el caso de audio) se conserva la integridad total de la reproduccion del sonido original en forma de una transformada afm de los primotrones de sonido similares, lo que conduce a una disminucion en la entropfa de la senal. La interfaz afm asociada con la formalizacion MSML puede usarse como una adicion o complemento de cualquier procedimiento de codificacion de audio u otros datos digitales para aumentar la relacion de compresion, asf como el proceso de compresion del nucleo, para la clase de senales donde los microfragmentos similares afines de tiempo-frecuencia contienen una parte esencial de la informacion de sonido (u otros datos digitales). Esta interfaz de codificacion de transformadas afines, mientras que se utiliza junto con la formalizacion MSML, esta configurada para utilizar microfragmentos espectrales similares de la senal digital (audio u otra) para aumentar la relacion de compresion de la senal. Durante el procesamiento, el rango espectral completo se divide en sub-bandas. Se realiza una busqueda de fragmentos espectrales similares en la parte anterior de la senal de sonido u otra senal de datos digital de forma independiente y utilizando una etapa diferente en cada sub-banda. Se usa una transformada affn de cambio de amplitud, tiempo y espectral durante la busqueda de fragmentos similares. Cada fragmento encontrado se resta del fragmento espectral original y el residuo se procesa adicionalmente como una diferencia de componentes espectrales, eliminando de este modo una redundancia significativa de los datos espectrales. Un esquema de decodificacion asociado para tal interfaz de codificacion de transformadas afines se muestra, por ejemplo, en la Figura 8B, con un esquema de decodificacion rapida opcional para tal interfaz de codificacion de transformadas afines que se muestra, por ejemplo, en la Figura 8C.
Un experto en la tecnica apreciara que los diversos aspectos de los procesos de manipulacion descritos en el presente documento tienen unicamente fines ejemplares y no deben considerarse de ninguna manera como limitantes con respecto a los diversos procesos de manipulacion que pueden aplicarse, ya sea en el presente o en el futuro, que puedan ser aplicable a la estructuracion de datos de informacion digital para reducir el tamano del archivo de datos digitales (es decir, reducir esa cantidad de datos reales o informacion que comprende el archivo de datos digitales), mientras se conserva un valor de informacion del archivo de datos digitales estructurado que se encuentra dentro de un valor de umbral del valor de informacion del archivo de datos digitales original. Un experto en la tecnica apreciara ademas que el valor de informacion del archivo de datos digitales estructurado puede, en algunos casos, tener una cantidad mucho menor de datos o informacion en comparacion con el archivo de informacion digital original, pero tambien puede tener una informatividad (es decir, valor de informacion) dentro de un valor de umbral del archivo de informacion digital original y, en casos particulares, incluso puede tener una mayor informatividad que el archivo de datos digitales original. Dicha estructuracion de los datos de acuerdo con los principios en el presente documento y de acuerdo con diversos aspectos de la presente descripcion se ilustran y se detallan con mas detalle, por ejemplo, en las Figuras 9-11.
En aspectos particulares, la aplicacion sucesiva de procesos de manipulacion para obtener un valor de informacion resultante dentro del umbral seleccionado del valor de informacion original puede comprender ademas la aplicacion sucesiva de dichos procesos de manipulacion, siendo el umbral seleccionado, por ejemplo, un lfmite de la percepcion humana (es decir, como se ha analizado anteriormente en relacion con los criterios de informacion perceptiva o, en el caso de los datos de audio, por ejemplo, los lfmites espectrales de la audicion humana), a fin de conservar la fidelidad del archivo de informacion digital estructurado primario con respecto al archivo de informacion digital original.
En el proceso de aplicar sucesivamente los procesos de manipulacion para formar los archivos de informacion digital resultantes, los archivos de informacion digital resultantes se forman de tal manera que cada archivo de informacion digital resultante comprende un conjunto de objetos y agrupaciones de objetos, en donde cada objeto y agrupacion de objetos tiene una definicion respectiva. Mas particularmente, puede aplicarse al menos un proceso de manipulacion para eliminar al menos un elemento del archivo de informacion digital procesado, y/o representar una combinacion de una pluralidad de elementos del archivo de informacion digital procesada con un elemento representativo, una primera indicacion asociada con una interrelacion entre el elemento representativo y al menos uno de la pluralidad de elementos en la combinacion, y una segunda indicacion asociada con una interrelacion entre al menos dos de la pluralidad de elementos en la combinacion. Por lo tanto, los archivos de informacion digital resultantes se forman de tal manera que los objetos y las agrupaciones de objetos en los mismos comprenden al menos uno de los elementos representativos y de tal manera que la definicion asociada con cada objeto y agrupacion de objetos comprende las primeras indicaciones de interrelacion y, opcionalmente, las segundas indicaciones de interrelacion, asociadas con al menos uno de los elementos representativos. En algunos casos, las definiciones pueden incluirse con el conjunto correspondiente de objetos y agrupaciones de objetos en cada archivo de informacion digital resultante (es decir, almacenadas juntos en el archivo). Sin embargo, en otros casos, las definiciones asociadas con el conjunto de objetos y agrupaciones de objetos se pueden mantener (es decir, almacenar) por separado de cada archivo de informacion digital resultante correspondiente. Por lo tanto, cada uno de los archivos de informacion digital resultante se puede formar de tal manera que cada archivo de informacion digital resultante posterior comprenda cualquier patron reconocido de objetos y agrupaciones de objetos dentro del archivo de informacion digital resultante anterior.
En otro aspecto, los procesos de manipulacion pueden aplicarse sucesivamente hasta que las aplicaciones sucesivas del proceso de manipulacion no logren una reduccion de umbral en la cantidad de informacion en el archivo de informacion digital resultante posterior. En tales casos, el ultimo archivo de informacion digital resultante puede tener una estructura de primotron de informacion que comprende un conjunto de objetos primarios, agrupaciones de objetos primarios, y cualquier interrelacion asociada con los mismos. Despues de la aplicacion de los procesos de manipulacion, cada archivo de informacion digital resultante y el ultimo archivo de informacion digital resultante se pueden analizar para determinar las correlaciones estadfsticas entre los objetos posteriores en un archivo de informacion digital posterior y las combinaciones anteriores de objetos anteriores en un archivo de informacion digital anterior. Ademas, para cualquier correlacion estadfstica que cumpla al menos con un umbral de correspondencia, una indicacion de correlacion del objeto posterior correspondiente y la combinacion anterior de los objetos se almacena para el analisis de un archivo de informacion digital original posterior.
En algunos casos, cada archivo de informacion digital resultante sucesivo puede analizarse para determinar al menos una correlacion objetiva entre una combinacion de objetos anteriores, y al menos una relacion entre objetos entre los objetos anteriores en la combinacion, en un archivo de informacion digital anterior. La al menos una correlacion objetiva y la al menos una relacion entre objetos se asocian entonces con un objeto posterior correspondiente en un archivo de informacion digital posterior. La al menos una correlacion objetiva y la al menos una relacion entre objetos asociada con el objeto posterior correspondiente, sobre una pluralidad de objetos posteriores, pueden formar colectivamente de este modo un conjunto de correlaciones de objetos representativas de las interrelaciones asociadas con el conjunto de objetos primarios y agrupaciones de objetos primarios en la estructura de primotron de informacion.
En otros casos, cada archivo de informacion digital resultante sucesivo puede analizarse para determinar al menos una correlacion objetiva entre una combinacion de objetos anteriores en un archivo de informacion digital anterior, y al menos una relacion entre objetos puede asignarse o designarse de otro modo entre los objetos anteriores en la combinacion. La al menos una correlacion objetiva y la al menos una relacion entre objetos pueden asociarse entonces con un objeto posterior correspondiente en un archivo de informacion digital posterior. La al menos una correlacion objetiva y la al menos una relacion entre objetos asociada con el objeto posterior correspondiente, sobre una pluralidad de objetos posteriores, pueden formar colectivamente de este modo un conjunto de correlaciones de objetos representativas de las interrelaciones asociadas con el conjunto de objetos primarios y agrupaciones de objetos primarios en la estructura de primotron de informacion.
En cualquier caso, el conjunto de objetos primarios y las agrupaciones de objetos primarios en la estructura de primotron de informacion puede entonces interpretarse mediante la evaluacion estadfstica de diversas combinaciones de las correlaciones de objetos en el conjunto de correlaciones de objetos y, para cualquier combinacion de correlaciones de objetos que cumpla al menos un umbral estadfstico, asociando las combinaciones con los objetos primarios y las agrupaciones de objetos primarios como una interpretacion contextual del conjunto de objetos primarios y las agrupaciones de objetos primarios en la estructura de primotron de informacion. Un archivo de informacion digital representativo asociado con el archivo de informacion digital original se puede sintetizar entonces, por ejemplo, aplicando la interpretacion contextual al conjunto de objetos primarios y agrupaciones de objetos primarios en la estructura de primotron de informacion.
Ademas, a partir del analisis de cada archivo de informacion digital resultante sucesivo, al menos un objeto, seleccionado de los objetos anteriores, los objetos posteriores, y los objetos primarios y agrupaciones de objetos primarios, pueden asociarse con una de una pluralidad de caracterfsticas del archivo de informacion digital original. De esta manera, una disposicion de la pluralidad de caracterfsticas puede determinarse con respecto a la duracion del archivo de informacion digital original, y una distribucion de al menos un objeto puede correlacionarse con respecto a la misma. En tales casos, se puede formar un archivo de datos de resumen, incluyendo el archivo de datos de resumen una representacion generalizada de la distribucion de al menos un objeto asociado con cada una de la pluralidad de caracterfsticas a lo largo de la duracion del archivo de informacion digital original.
En casos en los que la aplicacion sucesiva de procesos de manipulacion hasta aplicaciones sucesivas del proceso de manipulacion no logra una reduccion de umbral en la cantidad de informacion en el archivo de informacion digital resultante posterior, una cantidad y un orden de los procesos de manipulacion aplicados sucesivamente al archivo de informacion digital resultante posterior para obtener el ultimo archivo de informacion digital resultante que tiene la estructura de primotron de informacion se pueden catalogar, en donde la cantidad de procesos de manipulacion esta asociada con los niveles correspondientes de una jerarqufa de informacion.
Como tal, de acuerdo con algunos aspectos, un archivo de informacion digital representativo asociado con el archivo de informacion digital original puede sintetizarse, por ejemplo, de acuerdo con un proceso condicional que comprende las siguientes etapas:
1. Aplicar cualquier indicacion de correlacion aplicable al conjunto de objetos primarios y agrupaciones de objetos primarios en la estructura de primotron de informacion para determinar la combinacion anterior correspondiente de objetos asociados con los mismos;
2. Si no se determina ninguna indicacion de correlacion aplicable en la Etapa 1, aplicar la interpretacion contextual al conjunto de objetos primarios y agrupaciones de objetos primarios en la estructura de primotron de informacion para determinar la combinacion anterior correspondiente de objetos asociados con los mismos; y
3. si la aplicacion de la interpretacion contextual en la Etapa 2 esta por debajo de un valor de informacion de umbral asociado con el valor de informacion original, aplicar un proceso de manipulacion inverso inicial al conjunto de objetos primarios y agrupaciones de objetos primarios en la estructura de primotron de informacion, en donde el proceso de manipulacion inverso inicial es la primera manipulacion en el orden inverso de los procesos de manipulacion, para determinar la combinacion anterior correspondiente de objetos asociados con el mismo.
En algunos casos, para la combinacion anterior de objetos determinada a partir del conjunto de objetos primarios y agrupaciones de objetos primarios en la estructura de primotron de informacion, puede aplicarse al mismo el proceso condicional que incluye cualquier indicacion de correlacion aplicable, la interpretacion contextual correspondiente, o el siguiente proceso de manipulacion inversa en el orden inverso de los procesos de manipulacion correspondientes a la combinacion anterior de objetos, con el fin de determinar la siguiente combinacion anterior de objetos correspondientes con el mismo. Por lo tanto, puede desprenderse que el proceso condicional puede aplicarse sucesivamente a la siguiente combinacion anterior de objetos hasta que la combinacion anterior resultante de objetos se asocie con el nivel inicial de la jerarqufa de informacion, y el archivo de informacion digital anterior resultante corresponde de este modo al archivo de informacion digital representativo sintetizado.
Como se ha descrito previamente, la formalizacion MSML puede referirse a un metodo de estructuracion de informacion, en el que dicha informacion puede comprender, por ejemplo, informacion digital tal como datos de audio. Por consiguiente, otro aspecto mas de la presente descripcion puede implicar un metodo de evolucion de primotrones en diferentes niveles de la formalizacion MSML (es decir, estructura jerarquica) para el analisis de sonido o audio, en donde la evolucion de tales primotrones se puede lograr mediante la aplicacion de interfaces independientes a la formalizacion general MSML, en donde tales interfaces pueden comprender, por ejemplo, procesos de manipulacion para analizar y modificar la estructura de datos de la formalizacion MSML para facilitar tal evolucion de primotrones. Tal aspecto tambien puede incluir un metodo de sfntesis de sonido que utiliza el conjunto o combinacion de primotrones definidos y determinados en asociacion con la formalizacion MSML, e instrucciones y reglas particulares que definen la senal compleja proporcionada por la formalizacion MSML, a traves de la aplicacion de las interfaces de a las mismas, sucesiva y/o concurrentemente, asf como cualquier evolucion de dichos primotrones asociados con las mismas, para sintetizar o reconstruir una senal o archivo de sonido o audio que se corresponda sustancialmente con el archivo de audio digitalizado original.
En un ejemplo de tales interfaces (es decir, que representan un proceso de manipulacion que se puede aplicar a un archivo de audio digital u otro archivo de informacion) aplicado a la formalizacion general MSML, la reduccion del ancho de banda y la de la tasa de bits de los datos de audio puede realizarse utilizando una interfaz de codificacion sin fases para la formalizacion MSML de la composicion de sonido (vease, por ejemplo, la Figura 3A). Tal interfaz de codificacion sin fases se puede configurar, por ejemplo, para considerar una jerarqufa de valores de informacion perceptiva para determinar que datos del archivo se pueden conservar, transformar o descartar. Mas particularmente, una vez que se ha analizado la senal de audio digital y se ha determinado la formalizacion MSML correspondiente, se puede aplicar compresion sin perdida, por ejemplo, mediante un codificador de rango para procesar 1) estructuras armonicas en forma de un raster 2D; 2) envolvente de energfa total con alta resolucion de tiempo y varias bandas de frecuencia; y 3) relacion entre la energfa del ruido y la energfa total. El metodo de codificacion sin fases se puede aplicar a la formalizacion MSML para realizar, por ejemplo, tareas dirigidas a la reduccion seleccionada de los datos en la formalizacion MSML, mientras se conservan las estructuras de sonido de alta informatividad (es decir, un alto valor de informacion) asociada con la composicion del sonido, por ejemplo, a traves de la comparacion con metricas de sonido conocidas. Generalmente, un metodo de este tipo realiza una comparacion de objetos de sonido de diferentes niveles en el espacio, para determinar la integridad de las estructuras y el grado de degradacion de las mismas que puede resultar dentro de una representacion reducida (es decir, una cantidad de informacion o una tasa de bits inferior) de la senal de audio despues de la filtracion y/o el procesamiento, lo que facilita la seleccion de un parametro adecuado para cada elemento de sonido para lograr la reduccion de la cantidad de informacion/tasa de bits al tiempo que se conserva la informatividad. En algunos casos, la interfaz de codificacion sin fases esta configurada de manera apropiada de tal forma que la dependencia del tiempo de la senal no se conserve necesariamente, y las estructuras de sonido se conserven en lugar de la forma de onda de la senal, dando como resultado de este modo una disminucion del ancho de banda esencial y la tasa de bits. Para lograr una mayor velocidad de ancho de banda de audio y reduccion de la tasa de bits, las estructuras de nivel relativamente mas informativas de la formalizacion de composicion de sonido MSML pueden estar configuradas para mantener parametros constantes. Los parametros de las estructuras de nivel relativamente menos informativas pueden, por lo tanto, conservarse con menos precision o pueden generarse durante la decodificacion, por ejemplo, con el uso de valores aleatorios o parametros apropiados.
En otro ejemplo de tales interfaces/procesos de manipulacion que pueden aplicarse a la formalizacion MSML general, una interfaz de analisis de estructura de datos de audio para una formalizacion de composicion de sonido MSML puede configurarse para extraer elementos repetitivos difusos de tales composiciones de musica (vease, por ejemplo, las Figuras 4A y 4B). Tal interfaz de analisis de estructura puede configurarse para procesar datos de audio asociados con el archivo de datos de audio de formalizacion MSML para identificar elementos de bucle repetitivos difusos dentro de un nivel relativamente bajo de la jerarqufa de la formalizacion MSML. En tales casos, los elementos de bucle repetitivos difusos identificados como iguales pueden ser reemplazados por un elemento representativo y parametros caoticos asociados para proporcionar de este modo la cantidad de informacion/datos o la reduccion de la tasa de bits, sin disminuir apreciablemente el valor de informacion general o la informatividad. Tal interfaz puede comprender, por ejemplo, tres modulos. El primer modulo puede estar configurado para proporcionar la busqueda, el posicionamiento y el marcado de longitud de todos los elementos repetitivos difusos a lo largo de todo el nivel inicial de la formalizacion MSML. El segundo modulo puede configurarse para extraer un componente de sonido general para cualquier conjunto de fragmentos repetitivos difusos y para definir el nivel de cohesividad de los datos formando una senal residual correspondiente. El tercer modulo puede configurarse para realizar una construccion predictiva del fragmento de audio resultante integrando los elementos repetitivos extrafdos, los datos de marcado correspondientes y la informacion residual a partir de la senal residual. Puede usarse un metodo de filtrado para el modelado de fases para minimizar la informacion de la fase inicial requerida durante el proceso de construccion de sonido para el fragmento de audio resultante. Esta interfaz puede configurarse adicionalmente para usarse en una diversidad de aplicaciones, incluyendo, pero sin limitacion, motores de busqueda de musica, visualizacion de musica, y tecnologfas de compresion profunda de audio.
Otra interfaz/proceso de manipulacion ejemplar que puede aplicarse a la formalizacion MSML general implica la compresion de audio utilizando estructuras repetitivas de jerarqufa en la formalizacion de composicion de sonido MSML (vease, por ejemplo, la Figura 5). Esta avanzada interfaz de codificacion de repeticion sin fases identifica las estructuras formadas por el sonido de macrorepeticion o los primotrones de audio en el nivel mas alto de una jerarqufa de sonido de formalizacion MSML para proporcionar de este modo una cantidad adicional de informacion/datos o una reduccion de la tasa de bits, sin disminuir de forma apreciable el valor de la informacion general o la informatividad. Se utilizan dos tipos de datos para el proceso de codificacion: datos a gran escala que definen la estructura general dentro de la formalizacion MSML y datos que comprenden fragmentos de senales originales descritos por un nivel relativamente inferior dentro de la jerarqufa. Para comprimir los fragmentos de senal, se puede utilizar un codificador psicoacustico general, en algunos casos, posiblemente utilizando un enmascaramiento de senal externo. La reduccion de la tasa de bits se produce debido a la eliminacion de fragmentos repetitivos determinada en el nivel mas alto de la jerarqufa de formalizacion MSML, al tiempo que se almacena o se mantienen las ubicaciones de estos fragmentos. La equivalencia perceptiva de fragmentos repetitivos puede permitir una reduccion en el numero de muestras de referencia requeridas para las comparaciones.
Aun otra interfaz/proceso de manipulacion ejemplar que puede aplicarse a la formalizacion MSML general implica el ancho de banda de audio y la reduccion de la tasa de bits utilizando una interfaz de compresion sin perdida para una formalizacion de composicion de sonido de MSML (vease, por ejemplo, la Figura 6A) que puede configurarse para reducir el numero de matrices de valores enteros asociadas con la formalizacion MSML mediante el uso de un codificador de entropfa avanzado que realiza solo operaciones de enteros, sin divisiones y estimaciones de probabilidad secundarias. Dado que el codificador de rango y el modelo contextual de la interfaz no utilizan la operacion matematica de division, permite la aplicacion de esta interfaz a y/o la ejecucion de la interfaz por parte de muchos microordenadores de bajo coste que no tienen una operacion de division. Para mejorar la fiabilidad del modelo contextual de la interfaz, puede emplearse una estimacion de probabilidad secundaria (vease, por ejemplo, la Figura 6B). La estimacion de probabilidad secundaria es un modelo contextual complejo que utiliza la probabilidad predicha como un contexto con respecto a otro modelo. Es decir, por ejemplo, la estimacion de probabilidad secundaria puede implementarse como uno de los parametros caoticos que relacionan diferentes niveles de la jerarqufa. En este sentido, la estimacion de probabilidad secundaria bidimensional tambien se puede usar para mezclar dos modelos diferentes, en donde la estimacion de probabilidad secundaria bidimensional es una modificacion de la estimacion de probabilidad secundaria, que utiliza dos probabilidades de entrada para determinar un contexto. En algunos casos, tambien se pueden usar contextos enteros adicionales.
Todavfa otra interfaz/proceso de manipulacion ejemplar que se puede aplicar a la formalizacion MSML general implica la compresion de senales de audio para mejorar la codificacion aritmetica y el modelado contextual, para aumentar de este modo las relaciones de compresion y las velocidades de procesamiento, y permitir que los datos espectrales se compriman con alta eficacia y mayor velocidad. Tal metodo de compresion puede ser completamente automatizado y no requiere inicializacion previa para diferentes tipos de datos de audio. Es lo suficientemente flexible para ajustarse a diferentes tamanos de datos de audio espectral, lo que permite su uso con diferentes transformaciones espectrales. En lugar de un codificador aritmetico estandar, se utiliza un codificador de rango mas eficiente. El modelado de contexto se aplica al flujo de datos, los modelos algorftmicos construidos y la optimizacion algorftmica de una funcion de decodificador. Este aspecto tambien se basa, al menos parcialmente, en el uso de tecnicas de codificador de rango adaptativo que implican aumentar la probabilidad del valor codificado. Para mejorar la fiabilidad del modelo contextual, se puede emplear una estimacion de probabilidad secundaria.
Otra interfaz/proceso de manipulacion ejemplar que se puede aplicar a la formalizacion MSML general implica una transmision eficiente de datos de audio utilizando una interfaz de acelerador avanzado de datos de audio para una formalizacion de composicion de sonido MSML, y el uso de un proceso de perdida de calidad nula (NQL) para reducir el numero de coeficientes espectrales de tiempo-frecuencia cuantificados (QMDCT), para proporcionar de este modo una entrega mas rapida de los datos de audio sin una degradacion significativa de la calidad en el sonido resultante (veanse, por ejemplo, las Figuras 7A y 7B). El proceso NQL realiza una clasificacion de las estructuras de sonido dentro de la formalizacion MSML en funcion de su importancia, en una comparacion basada, por ejemplo, en el lfmite o umbral de la percepcion humana. Es decir, por ejemplo, la perdida de calidad de informacion sera minima, si la hay, si la cantidad de informacion se reduce en datos que se aproximan o superan el lfmite o el umbral de la percepcion humana. La avanzada interfaz del acelerador puede configurarse para reconstituir los coeficientes espectrales cuantificados de tiempo-frecuencia del formato inicial, sin la descuantificacion de los datos ni la transcodificacion inversa a traves del formato PCM. La avanzada interfaz del acelerador puede, por ejemplo, dividir el archivo codificado inicialmente de los coeficientes espectrales del dominio del tiempo-frecuencia en tres grupos, donde los coeficientes de los grupos espectrales de baja frecuencia se mantienen sin cambios, mientras que algunos coeficientes de los grupos espectrales de frecuencia intermedia pueden ponerse a cero utilizando el proceso NQL, y los coeficientes del tercer grupo (frecuencias mas altas) pueden eliminarse reemplazandolos con los subgrupos de coeficientes mas similares, uniendolos en grupos bajos e intermedios, y guardando una referencia a este subgrupo buscado, asf como un factor integral, sin afectar a los elementos de sonido estructurales (armonicos y aciertos).
Otra interfaz/proceso de manipulacion ejemplar que puede aplicarse a la formalizacion MSML general implica reducir el tamano del archivo de datos de audio (cantidad de informacion o tasa de bits), utilizando una interfaz de codificacion de transformadas afines para una formalizacion de composicion de sonido MSML (vease, por ejemplo, la Figura 8A), conservando al mismo tiempo la integridad (valor de informacion) del archivo de datos de audio original. Tal interfaz puede implementar una transformada affn de primotrones de sonido/audio similares, lo que conduce a una disminucion en la entropia de la senal (es decir, una estructuracion mas alta proporciona menos entropia y, posiblemente, una disminucion en la cantidad de informacion o la tasa de bits). La interfaz de transformada affn asociada con la formalizacion MSML se puede usar como una adicion o un complemento para cualquier procedimiento de codificacion de audio, por ejemplo, como los descritos en el presente documento, para aumentar la relacion de compresion del mismo, asf como para proporcionar un proceso de compresion central, para senales de sonido/audio donde los microfragmentos similares afines en el dominio del tiempo-frecuencia son esenciales para el valor de la informacion de sonido. Esta interfaz de codificacion de transformadas afines, al mismo tiempo que puede usarse junto con la formalizacion MSML, esta configurada para utilizar microfragmentos espectrales similares de la senal de audio digital para aumentar la relacion de compresion de esa senal. Durante el procesamiento, el rango espectral completo se divide en sub-bandas. Se realiza una busqueda de fragmentos espectrales similares en la parte anterior de la senal de sonido de forma independiente y utilizando una etapa diferente en cada sub-banda. Se usa una transformada affn de cambio de amplitud, tiempo y espectral durante la busqueda de fragmentos similares. Cada fragmento encontrado se resta del fragmento espectral original y el residuo se procesa adicionalmente como una diferencia de componentes espectrales, eliminando de este modo una redundancia significativa de los datos espectrales, y reduciendo de este modo la cantidad de informacion o la tasa de bits en el proceso.
En terminos practicos (como se ilustra, por ejemplo, en las Figuras 9-11), un archivo de audio digital esta representado por una matriz de bits, que despues puede analizarse de manera apropiada para detectar patrones de bits que representan diversos niveles de informatividad, y tales patrones de bits basicos pueden denominarse "primotrones" de acuerdo con diversos aspectos de la presente divulgacion abordada en el presente documento.
Debido a que la matriz de bits puede extenderse sobre multiples dimensiones, y dado que los patrones de bits pueden tener diferentes estructuras/combinaciones que pueden abarcar mas de una dimension de la matriz de bits (es decir, proporcionar diversos niveles de informatividad), los primotrones pueden caracterizarse como objetos o entidades de multinivel y multiestructurales (MSML) que proporcionan un paradigma novedoso para la formalizacion digital de medios tal como el sonido o el audio. Tal procedimiento de formalizacion y el archivo de audio digital formalizado producido a partir del mismo se describen en la presente solicitud, asf como diversos metodos mediante los cuales los primotrones pueden identificarse o determinarse de otra manera, y diversos metodos mediante los cuales dichos primotrones pueden (re)combinarse o analizarse de otro modo para sintetizar una representacion del archivo de audio digital original que se encuentra dentro de un umbral del mismo. Dado que un aspecto de la presente descripcion implica reducir la cantidad de informacion o la tasa de bits del archivo multimedia digital original, mientras se mantiene una cantidad de informacion dentro de su umbral, un experto en la tecnica apreciara que se pueden obtener beneficios y ventajas adicionales en terminos de, por ejemplo, transmision de datos, almacenamiento de datos, seguridad de datos y similares, como se detalla adicionalmente en el presente documento.
Dado que un primotron, determinado por aspectos de un metodo de formalizacion como se describe en el presente documento, representa un patron o combinacion de uno o mas bits o elementos de datos en los diversos niveles y/o dimensiones de la matriz de bits del archivo de audio digital, se deduce que el archivo de audio digital puede representarse posteriormente mediante una combinacion de dichos primotrones identificados y/o determinados a incluir en el mismo. Es decir, el archivo de audio digital puede estar sujeto a formalizacion MSML, y luego se puede analizar la formalizacion MSML para determinar la combinacion de dichos primotrones o elementos de datos presentes en el mismo. Tal analisis puede, por ejemplo, caracterizarse como un "sistema vivo" de patrones de sonido que interactuan en condiciones particulares dentro de una cantidad limitada de informacion. La evolucion o "historia de vida" de dichos patrones puede caracterizarse adicionalmente por los principios de evolucion de la informacion en un sistema caotico dinamico definido por un numero finito de estructuras, concretamente, los primotrones tienen cada uno una "vida util" que puede variar desde una fraccion de segundo hasta varios minutos dentro del tiempo o la duracion del tiempo-frecuencia del archivo de audio digital. Debido a que el archivo de audio digital ahora esta representado por tal combinacion o sistema vivo de primotrones, en donde cada primotron representa un subconjunto de bits de la matriz de bits para u otra estructura o entidad asociada con ese archivo de audio digital, el archivo de audio MSML que incluye la combinacion identificada de primotrones puede presentar, por ejemplo, un tamano del archivo de datos reducido (cantidad de informacion) en comparacion con el archivo de audio digitalizado original (al mismo tiempo que conserva la calidad de la informacion del archivo de audio digital dentro de un umbral perceptivo del archivo de audio digital original). En algunos casos, tal reduccion puede ser, por ejemplo, del orden de aproximadamente 20 veces a aproximadamente 60 veces menor que el tamano del archivo de datos original, aunque la reduccion del tamano del archivo de datos que puede lograrse puede ser incluso mayor de 60 veces, por ejemplo, a medida que otros primotrones y metodos asociados se identifican o se determinan y refinan de otra manera, en donde dichos primotrones pueden facilitar la reduccion en la cantidad de informacion o la tasa de bits para el archivo de audio digital en particular, mientras se mantiene la informatividad del archivo de audio digital dentro de un umbral perceptivo del archivo de audio digital original. En otros casos, puede ser posible que un subconjunto de la combinacion de primotrones u otros elementos de datos en el archivo de datos se represente mediante un objeto mas general u otra entidad, lo que reduce aun mas el tamano del archivo de datos en comparacion con el archivo de audio digital original (y/o formalizacion MSML del mismo). Por consiguiente, tal paradigma forma la base de un formato de datos digitales multifuncional y altamente estructurado configurado para un almacenamiento y reproduccion altamente compactos y eficaces de cualquier material representado en forma de una senal de audio de alta fidelidad de base o construccion armonica (incluyendo musica, voz y otros medios basados en un sonido rico), dentro de un umbral de la senal de datos digital original.
En la identificacion de las diversas combinaciones de elementos que forman los diversos primotrones u otros elementos de datos, el elemento representativo resultante tambien puede asociarse con parametros particulares (es decir, denominados en el presente documento como parametros caoticos, o de otro modo como un archivo de datos asociado con caracterfsticas particulares del elemento representativo) que representan, por ejemplo, el contexto u otras caracterfsticas del elemento representativo y/o los elementos de datos o primotrones a partir de los cuales se determino el elemento representativo. Dichos parametros pueden comprender, por ejemplo, relaciones entre elementos de datos en el mismo nivel de la jerarqufa, relaciones entre elementos de datos a traves de diferentes niveles de la jerarqufa, relaciones entre elementos de datos de una jerarqufa de nivel inferior y su relacion con un elemento de datos en una jerarqufa de nivel superior. Ademas, dado que dichos primotrones se definen dentro de una cantidad limitada de informacion finita, los patrones identificados asociados con dichos primotrones pueden asociarse con diversos aspectos correspondientes del archivo de audio digital. Por ejemplo, ciertos primotrones pueden representar armonicos, mientras que otros pueden representar voces, instrumentos particulares, frecuencias o rangos de frecuencia especfficos, acustica del lugar, o cualquier otro aspecto identificable del archivo de audio digital asociado con una actuacion musical u otra basada en armonicos.
Por lo tanto, se deduce que un aspecto de la formalizacion MSML (es decir, la representacion del archivo de audio digitalizado por una combinacion de primotrones) del archivo de audio digital es que los bits en la matriz de bits que no estan necesariamente identificados/determinados como un componente de un primotron en la combinacion de primotrones, se puede designar como ruido (es decir, ruido blanco o, de otro modo, ruido periferico que no es necesariamente significativo para la naturaleza del archivo de audio digital que se esta convirtiendo en una formalizacion MSML (es decir, tiene un efecto prejudicial limitado en la calidad de la informacion del archivo de audio digital). En tales casos, es posible que el ruido no se incluya o se elimine de otro modo de la representacion MSML. Sin embargo, puede haber casos en los que algunos o todos los "ruidos" puedan ser deseables para permanecer incluidos en la representacion MSML. Por ejemplo, en casos en que el archivo de audio digital representa una actuacion musical en vivo, parte del ruido puede atribuirse a la acustica del lugar de la actuacion o la reaccion de la audiencia a la actuacion. Como tal, puede ser deseable, en algunos casos, incluir dicho "ruido" con la representacion MSML del archivo de audio digital para proporcionar vida, ambiente o de otro modo un contexto al contenido del archivo de audio. De este modo, el "ruido deseable" se puede separar en elementos de ruido, siendo cada elemento de ruido representado por un primotron periferico respectivo. De tal manera, uno o mas primotrones perifericos, o diversas combinaciones de los mismos, pueden incluirse selectivamente en la representacion MSMl . Es decir, dichos primotrones perifericos pueden incluirse en la representacion de MSML si es necesario o deseable, o eliminarse de otro de la representacion MSML.
Otro aspecto asociado con lo anterior es que, dado que la representacion MSML del archivo de datos original esta en la forma de una combinacion de primotrones u otros elementos de datos, y dado que los primotrones perifericos pueden identificarse/determinarse e incluirse selectivamente en o excluirse de la representacion MSML, entonces es posible que una o mas subcombinaciones de la combinacion de primotrones se identifiquen/determinen y se incluyan selectivamente o se excluyan de la representacion MSML. Por ejemplo, con respecto a la interpretacion musical en vivo mencionada anteriormente, la combinacion de primotrones incluida en la representacion MSML puede incluir solo la musica de los instrumentos que se tocan. En tales casos, puede ser posible, por ejemplo, identificar la musica de instrumentos individuales de tal manera que la interpretacion se pueda separar en "pistas", cada una asociada con un instrumento respectivo. Por consiguiente, el procesamiento agregativo eficiente simultaneo y sincronizado puntualmente de la informacion relativa y relacionada con la senal de audio y su entrega en red rastreable, puede optimizarse dinamicamente sobre una infraestructura de IP terrestre y movil, en donde tales archivos de audio representados por MSML pueden ser capaces de transportar de forma simultanea y extraer dinamicamente representaciones de senales planas y volumetricas en alta definicion (incluyendo, por ejemplo, sonido estereo 2.0 y sonido envolvente 5.1) y dentro de un solo archivo de datos a una tasa de bits baja, y tambien pueden ser capaces de extraer en tiempo real una voz cantada, con una calidad de sonido completamente transparente y reproducible de la fuente de sonido original. Dado que una caracterfstica particular de las representaciones MSML de los archivos de audio digital es una cantidad de informacion o tasa de bits significativamente inferior, que tiene un valor de informacion dentro de un umbral o incluso superior a la calidad de la informacion del archivo de audio digital original, dichas capacidades ejemplares descritas en el presente documento pueden reducir significativamente los gastos relacionados con el almacenamiento digital, la transmision, la difusion y el ancho de banda de los sistemas de centralidad mediatica y redes, al mismo tiempo que se abren nuevas fuentes de ingresos y se aumenta la monetizacion del contenido.
Por ejemplo, otro aspecto asociado con la capacidad de analizar el archivo de datos de audio original o de otro modo segregar el archivo de datos de audio de acuerdo con caracterfsticas particulares con respecto a una representacion MSML es que, en algunos casos, puede ser posible crear o transferir primotrones secundarios particulares para la inclusion selectiva en la representacion MSML. Por ejemplo, con respecto a la actuacion musical en vivo mencionada anteriormente, las caracterfsticas de la acustica de un lugar diferente se pueden capturar o recrear digitalmente y luego convertir en una representacion MSML como uno o mas primotrones. En tales casos, puede ser posible que el componente del lugar se elimine de la representacion MSML del archivo de audio digital y luego se reemplace con el primotron o primotrones asociados con el lugar diferente. Por lo tanto, un experto en la tecnica apreciara que los primotrones pueden disponerse en muchas combinaciones diferentes para proporcionar una representacion MSMl deseada, ya sea que los primotrones se originen o no a partir del archivo de audio digital original.
Ademas del concepto de disponer primotrones en muchas combinaciones diferentes para proporcionar una representacion MSML deseada, un experto en la tecnica tambien apreciara que se pueden crear primotrones u otros elementos de datos para representar otras entidades dentro de la representacion MSML del archivo de audio digital.
Por ejemplo, un primotron de este tipo u otro elemento de datos puede asociarse con indicaciones unicas que representan, por ejemplo, al propietario o poseedor de la representacion MSML del archivo de audio digital. Mas particularmente, tras la conversion del archivo de audio digital a formato MSML, se puede generar una combinacion unica de primotrones u otros elementos de datos para identificar al usuario particular que tiene derecho a la representacion MSML del archivo de audio digital, ya sea el usuario, por ejemplo, un propietario de contenido, un licenciatario de contenido, un comprador de contenido o, de otro modo, una entidad que adquiere un derecho de acceso al contenido. En algunos casos, las indicaciones unicas pueden configurarse para que sigan siendo una parte de la representacion MSML (es decir, no "borrables" o removibles de otro modo) independientemente de la manipulacion del archivo de representacion MSML por parte del usuario o el poseedor o poseedores posteriores del mismo. Por consiguiente, como se apreciara por los expertos en la tecnica, las indicaciones unicas proporcionar, en algunos casos, una "marca de agua" o, de lo contrario, una caracterfstica de seguridad para la representacion MSML particular del archivo de audio digital original. Tales indicaciones unicas tambien pueden configurarse o disponerse, en algunos casos y configuradas para conservar una parte de la representacion MSML o no, para representar otros aspectos del archivo de representacion MSML, en donde tales indicaciones unicas pueden comprender, por ejemplo, metadatos (es decir, palabra clave, referencia, clasificacion, datos de seguridad, etc.), como apreciara un experto en la tecnica.
En algunos casos, las indicaciones unicas incluidas en la representacion MSML del archivo multimedia digital pueden hacerse evidentes o controlarse de otra manera a traves de un canal de datos dedicado configurado para funcionar junto con la senal armonica codificada para reflejar dinamicamente y mostrar informacion interestructural en el dominio del tiempo, permitiendo de este modo la reproduccion sincronizada de audio con cualquier evento exterior o externo. Por ejemplo, tras determinar la estructura de primotron de un archivo multimedia digital particular, los primotrones que comprenden el archivo, incluidas las indicaciones unicas, pueden disponerse en el dominio del tiempo. Con el conocimiento de la estructura o las caracterfsticas particulares de los primotrones particulares y la ubicacion de los mismos en el dominio del tiempo en asociacion con la duracion del archivo multimedia digital, dicho conocimiento se puede usar para impulsar ciertos eventos o para tener ciertos casos de informacion asociados con los mismos. Dichos eventos externos pueden incluir, por ejemplo, video o una secuencia de programacion en un juego o pelfcula, letras de canciones, portadas, credenciales de artistas y compositores o partituras, varios efectos especiales visuales y pirotecnicos, incluyendo iluminacion interior y exterior o audiolibros visuales, publicidad dirigida o cualquier otra informacion relacionada con los medios de sonido reproducidos. Es decir, por ejemplo, un primotron o una combinacion de primotrones puede designarse dentro del canal de datos dedicado como impulsor de un evento o efecto externo particular. Cuando el canal de datos dedicado tiene el archivo de audio formalizado en MSML combinado con el mismo o introducido de otro modo en el mismo, las apariciones de primotrones particulares o combinaciones de los mismos a lo largo de la duracion del archivo de audio formalizado en MSML sirven para dirigir el evento o efecto externo correspondiente en el momento particular durante la ejecucion del archivo de audio formalizado en MSML, aumentando de este modo la informatividad y la personalizacion de los medios recibidos, y mejorando sustancialmente el valor de entretenimiento y la monetizacion de los mismos.
Mas particularmente, con respecto al aspecto del canal de datos dedicado, durante el proceso de codificacion y conversion de archivos datos de audio en bruto (PCM, wav, aiff) y MP3, AAC, OGG, WMA de alta tasa de bits (es decir, aproximadamente 192 kbit/s, y superior) en la formalizacion MSML, se identifican y extraen un conjunto de estructuras que tienen propiedades y caracterfsticas unicas que representan los datos de audio (es decir, primotrones y descripciones de multiples niveles que utilizan los mismos). La representacion de los datos de audio de tal manera permite que se proporcione un canal de datos interactivo, completamente integrado e inteligente, en asociacion con la formalizacion MSML. Por ejemplo, el canal de datos puede configurarse para incluir una diversidad de informacion relacionada y asociada con la formalizacion MSML de los datos de audio u otros datos multimedia. Mas particularmente, el canal de datos puede configurarse para recibir datos indicativos de uno o mas eventos asociados con un elemento de primotron particular y/o de descripcion de nivel multiple en la formalizacion MSML. En otros casos, los datos pueden asociarse generalmente con la composicion musical general. Por ejemplo, un evento de este tipo puede incluir un atributo de audio y/o sonido asociado con una nota, una o mas letras con tiempo y duracion particulares asociados con una palabra, la "partitura" asociada con la composicion musical, la identificacion de la licencia, los derechos de autor y la informacion legal junto con una diversidad de datos subordinados, tales como enlaces a otras opciones de audio, imagen y video, materiales de texto relacionados, incluidas noticias, eventos o similares.
En un ejemplo, una composicion de sonido puede procesarse en la formalizacion MSML asociada, que incluye los primotrones mencionados anteriormente y las descripciones de multiples niveles. En la preparacion de la formalizacion MSML, el archivo de datos correspondiente puede configurarse para que los datos en el mismo puedan comunicarse con datos externos (es decir, el archivo de datos puede configurarse para comunicarse con el "canal de datos"). Dichos datos externos pueden configurarse para relacionar un primotron particular, una descripcion particular de multiples niveles, o combinaciones de los mismos, con una accion, evento, efecto, etc. particular. Por ejemplo, los datos externos pueden configurarse para ejecutar el funcionamiento de fuentes de agua decorativas. Por consiguiente, diversas caracterfsticas de la composicion de sonido pueden correlacionarse con diversas caracterfsticas operativas de las fuentes de agua. En aspectos particulares, por ejemplo, el volumen a lo largo de la duracion del tiempo de la composicion de sonido puede correlacionarse con el volumen o la presion del agua dirigida a traves de una o mas de las fuentes; diversos instrumentos pueden estar correlacionados con diversos subgrupos de las fuentes; las letras pueden estar correlacionadas y sincronizadas con luces que iluminan las distintas fuentes. Por consiguiente, los diversos primotrones y las descripciones de multiples niveles que se determinan a partir de la formalizacion MSML para la composicion de sonido particular pueden configurarse automaticamente para controlar o de otra manera afectar a la aplicacion particular. Como tal, la aplicacion particular puede cambiarse facilmente simplemente asociando una formalizacion MSML de una composicion de sonido diferente con la aplicacion particular a traves del canal de datos dedicado. Un ejemplo similar puede vincularse a la pirotecnia, tal como, por ejemplo, en una exhibicion de fuegos artificiales. Como tal, cuando se configura de esta manera, la composicion de sonido se utiliza para "dirigir" la aplicacion particular por la naturaleza misma de la formalizacion MSML de esa composicion de sonido. Es decir, la configuracion particular del canal de datos puede seguir siendo la misma (es decir, ciertos primotrones o combinaciones de los mismos controlan eventos externos correspondientes particulares), pero el cambio de la composicion del sonido se produce una formalizacion MSML diferente asociada con esa composicion de sonido particular y, debido a que los eventos de primotron tendran lugar en diferentes momentos a lo largo de la duracion del tiempo que otra composicion de sonido, los eventos externos asociados con el canal de datos seran controlados en una secuencia diferente que con una composicion de sonido diferente. Por consiguiente, la formalizacion MSML de una composicion de sonido puede simplemente reemplazarse con una formalizacion MSML de otra composicion de sonido para afectar a un cambio en la aplicacion particular, por ejemplo, un videojuego basado en las caracterfsticas de una composicion musical (es decir, un videojuego basado en karaoke). Tal esquema contrasta fuertemente con el estado de la tecnica en el que cada composicion de sonido tendrfa que ser analizada y los eventos individuales asociados con la aplicacion particular tendrfan que estar correlacionados con aspectos particulares de esa composicion de sonido, en un proceso que consume mucho tiempo. Para cambiar la composicion del sonido en tales casos, habrfa que repetir el minucioso proceso de correlacion manual.
Un experto en la tecnica tambien apreciara que el concepto de canal de datos tambien puede tener capacidades adicionales con respecto a la cooperacion con una formalizacion MSML. Por ejemplo, una composicion de sonido particular puede, en algunos casos, tener letras y/o videos correspondientes asociados. Como se describe, la composicion de sonido puede representarse por una formalizacion MSML de acuerdo con los diversos aspectos de la presente descripcion como se detalla en el presente documento. En algunos casos, las letras y/o el video se pueden correlacionar con el perfil de primotron de la composicion de sonido en el dominio del tiempo o dominio de tiempo-frecuencia. Es decir, las apariciones dentro de las letras y/o el video pueden estar asociadas con el perfil de primotron en el dominio del tiempo de la composicion del sonido. Como tal, la interaccion entre la formalizacion MSML de la composicion de sonido y el canal de datos que tiene las letras y/o el video asociado con la misma, puede presentar una situacion en la que los perfiles entre los mismos pueden estar correlacionados (es decir, de acuerdo con una aparicion en el dominio del tiempo, de primotrones particulares o combinaciones de los mismos). En la forma de realizacion de la correlacion, la formalizacion MSML de la composicion del sonido esencialmente se sincroniza con las letras y/o el video asociados con el canal de datos debido a la correspondencia de los perfiles de primotron del dominio del tiempo. Por consiguiente, en algunos casos, la sincronizacion dinamica puede lograrse o realizarse, ya que la correlacion entre el canal de datos y la formalizacion MSML de la composicion del sonido es esencialmente en tiempo real. Una implicacion practica es, por ejemplo, que la formalizacion MSML de la composicion del sonido puede estar en el proceso de realizarse o ejecutarse, y puede ponerse en interaccion con el canal de datos en cualquier momento durante esa duracion, en donde, tras dicha interaccion, el video y/o las letras asociadas con el canal de datos pueden sincronizarse dinamicamente con la composicion de sonido esencialmente en tiempo real. Esto puede permitir, por ejemplo, el acoplamiento y el desacoplamiento a voluntad del canal de datos con la formalizacion MSML de la composicion del sonido, sin tener que recurrir al origen del tiempo (es decir, t = 0) para realizar la correlacion.
En algunos aspectos, los datos externos asociados con el canal de datos pueden dirigirse a un repositorio especial o ubicacion dentro del archivo de datos de la formalizacion MSML de la composicion de sonido. De tal manera, los datos externos se pueden implementar antes y de forma correspondiente con el sonido sintetizado y reproducido a partir de la formalizacion MSML de la composicion de sonido. Por consiguiente, un aspecto de reproduccion apropiado puede configurarse para proporcionar acceso al repositorio (datos externos) de informacion de sonido recopilada, y puede configurarse para recibir el contenido deseado (es decir, diferentes composiciones de sonido y/o video) a traves del canal de datos dedicado, y en sincronicidad completa entre los mismos, mientras que simultaneamente se decodifican los datos de sonido para crear una experiencia de usuario de contenido interactivo enriquecida. Dichos aspectos permiten la creacion de una musica inteligente de multiples dimensiones y aplicaciones relacionadas que incluyen, pero sin limitacion, una variedad de servicios interactivos de musica y video, y juegos donde los usuarios y los entornos interactuaran con el medio y entre si (es decir, una nueva forma de experimentar la musica proporcionando a los usuarios contenido interactivo de primera calidad para experiencias de reproduccion personalizadas, por ejemplo, donde la musica dirige o controla de otro modo la experiencia).
El canal de datos puede estar compuesto por datos recopilados durante el proceso de formalizacion MSML y sfntesis de la misma composicion de sonido/datos de audio digital y cualquier informacion externa vinculada a la composicion de sonido, y puede configurarse para incorporar la informacion deseada en la formalizacion MSML durante un proceso de codificacion correspondiente o como una adicion de procesamiento posterior de una formalizacion MSML ya codificada de acuerdo con, pero sin limitacion, la siguiente estructura.
Es decir, en algunos aspectos, el canal de datos senalado puede incluir varios tipos de datos informativos relacionados con eventos externos y/o en correspondencia con una formalizacion MSMl de una composicion de sonido configurada para interactuar con los mismos, en donde un ejemplo es el siguiente:
- General:
- Basico - datos codificados tanto en el encabezado del archivo como en cada bloque (tfpicamente en un intervalo de 10 s) identificando el contenido de la reproduccion, y quien ha codificado y decodificado el archivo original y toda la informacion avanzada correspondiente:
- ID de cancion - identificador unico de la cancion o composicion de audio, mediante el cual se puede recibir cualquier informacion adicional de la cancion desde un repositorio informatico en la nube
- LDE
- ID de codificador
- ID de codificador
- Periodo de validez de la licencia
- Nombre de la cancion
- Nombre del album
- Nombre(s) del (de los) artista(s)
- Numero total de patrones
- Numero total de repeticiones
- Avanzado
- Interno
- Bloque
- Trama
- Externo
- Primario
- Secundario
- Datos generales que representan la siguiente informacion:
- Avanzado (datos codificados en el encabezado del archivo)
- Datos identificativos de la cancion:
- Numero de pista dentro del album, numero de disco (para una coleccion de multiples discos), album con espacios o sin espacios
- Genero musical, subgenero musical, estilo
- Composicion primaria o remix
- Idioma(s) principal(es) de la actuacion
- Derechos de autor:
- Nombre del titular de los derechos de autor
- Fecha de lanzamiento
- Tipo de licencia
- Duracion de la licencia (fecha de inicio y vencimiento)
- Region de aplicabilidad de la licencia
- Nombre del estudio de grabacion
- Credenciales:
- Autor de la musica (compositor(es) de la musica)
- Autor de la letra de la cancion
- Lista y numero total de diversos instrumentos utilizados para crear la cancion y su ID respectiva dentro de la pista
- Cada artista instrumental (es decir, los nombres de todos los artistas que tocaron los instrumentos mencionados en la Informacion general)
- Ingeniero(s) de audio
- Disenador grafico
- Caracterfsticas tecnicas:
- Formato de la cancion (mono, estereo, multicanal 5.1, etc.)
- Caracterfsticas del archivo de salida: Discretizacion (44,1/48/96/192 KHz), resolucion de profundidad de bits (16/24/32)
- Desviacion del nivel de volumen del sonido respecto al promedio (es decir, cuanto debe ajustarse el nivel de la cancion para proporcionar un nivel constante dentro de la cancion y/o proporcionar una reproduccion continua de nivel equivalente entre varias canciones) - Interno:
- por Bloque:
- Datos basicos
- Ritmo
- Tempo
- Definiciones de senales estereo
- Mascara de tiempo-frecuencia y otra informacion mediante la cual el usuario puede filtrar instrumentos especfficos de la mezcla
- Definiciones de melodfa:
- Tipo de escala
- Enlace(s) con marca de tiempo a informacion remota (audio, video, texto) y su duracion correspondiente - Caracterfsticas sonoras de sello de tiempo y su duracion correspondiente:
- Aciertos con brillo correspondiente
- Armonicidad:
- Identificacion del instrumento y correspondientes definiciones de espacio volumetrico - La proporcion de cada instrumento dentro de la mezcla y dentro de un canal particular, incluido el retardo de tiempo, etc.
- Numero total de los instrumentos en el bloque
- Definicion de voz/instrumento
- Vocal
- Consonante
- Armonias disonantes
- Clases de paso
- Eventos musicales:
- Nivel medio de sonoridad (AVL)
- Aumento del nivel de sonoridad
Disminucion del nivel de sonoridad
- Secuencia ascendente de escala
- Secuencia descendente de escala
- Ataque de tono
- Tono senuelo
- Duracion del tono
- Paso de tono
- Intensidad de tono (sonoridad)
- Dedal de tono (o calidad)
- Aspectos aperiodicos:
- transitorios de ataque
- vibrato
- modulacion de envolvente
- Patrones y Repeticiones
- Numero de patrones por bloque
- Identificacion de patrones
- Numero de repeticiones por bloque
- Identificacion de repeticion
- Letras en idioma principal
- por Trama:
- Caracterfsticas de la composicion:
- Letras de canciones:
- Ubicacion en el tiempo y duracion de cada palabra de la letra a traves de la trama - Ubicacion de los aciertos
Caracterfsticas de los aciertos:
- brillo
duracion
- Etapas de escala
- Ubicacion de escenas sonoras altamente estructuradas armonicamente
- nivel de armonicidad
- nivel de pureza de senal
- ubicacion de las repeticiones de armonicos
- ubicacion para cada patron especffico
- Externo:
- Primario (informacion almacenada, por ejemplo, en el repositorio de musica en la nube)
- Informacion general
- Diseno correspondiente
- Gufas adicionales
- Contenido de huella digital de audio
- Musica de la ficha de la cancion
- Secundario (informacion almacenada, por ejemplo, externamente a un repositorio de musica de computacion en la nube)
- cualquier texto junto con su sincronizacion temporal y la duracion de la visibilidad del texto a traves de la cancion (fragmento)
cualquier enlace junto con su sincronizacion temporal y la duracion de su visibilidad a traves de la cancion (fragmento)
En terminos practicos, el canal de datos dedicado puede ayudar a aumentar la versatilidad de la formalizacion MSML del archivo de audio digital. Mas particularmente, dentro del esquema de formalizacion MSML, la caracterizacion de los datos de audio (o video, en algunos aspectos) permite que las representaciones objetivas de esos datos actuen como un representante bajo la formalizacion MSML. Mas particularmente, la cantidad relativamente limitada de representaciones objetivas, asf como las definiciones particulares de esas representaciones, permiten disponer diversas combinaciones de estas representaciones de una manera que refleja la configuracion de los datos de audio originales (es decir, los datos de audio estan representados por diversas combinaciones dentro del conjunto conocido de representaciones objetivas, lo que proporciona un universo definido para caracterizar cualquier composicion de sonido). De esta manera, el procedimiento y la estructura de formalizacion MSML minimizan o eliminan de otro modo los criterios subjetivos o no estandar encontrados cuando se analiza convencionalmente el sonido desde una perspectiva de onda.
El universo definido de representaciones objetivas permite ademas que las composiciones de sonido se descompongan en elementos individuales (es decir, instrumentos, letras de canciones, etc.), donde dichos elementos pueden incluirse, eliminarse, reemplazarse o manipularse de otra manera, segun se desee. En algunos aspectos, una composicion de sonido se puede formar utilizando las representaciones objetivas formalizadas MSML como los "componentes basicos" o la base de la composicion. Ademas, los datos externos, tales como los metadatos, la informacion de seguridad, el material de derechos de autor, etc., pueden anadirse a la formalizacion MSML, en donde dichos datos externos, mientras se encuentran en forma digital, pueden proporcionarse con representaciones objetivas que pueden distinguirse de las representaciones objetivas de la composicion de sonido. De esta manera, los datos externos pueden sintetizarse, implementarse, analizarse o manipularse de otra manera, sin alterar o afectar de otro modo a las caracteristicas de la propia composicion de sonido (es decir, los datos externos pueden configurarse para que puedan distinguirse objetivamente de los datos que representan la composicion de sonido formalizada en MSML).
En aspectos particulares, las representaciones objetivas realizadas por la formalizacion MSML pueden ser utiles, por ejemplo, para analizar de manera objetiva varias composiciones de sonido (es decir, como una herramienta "forense de derechos de autor"), o como un controlador u otro componente asociado de un sistema "dirigido" (es decir, una pantalla pirotecnica, una fuente dinamica, un videojuego, etc.). Es decir, las representaciones objetivas pueden vincularse o configurarse de otro modo para activar las funciones correspondientes que pueden definirse a traves de la asociacion con datos externos. El canal de datos dedicado mencionado anteriormente se puede usar para introducir una composicion de sonido en las funciones definidas (en un formato formalizado en MSML), o viceversa, dentro de la estructura armonica de la representacion formalizada en MSML de la composicion de sonido.
En otros aspectos, la formalizacion MSML de la composicion de sonido, que da como resultado representaciones objetivas de la composicion de sonido, puede facilitar un esquema de eventos basado en elementos, que puede no estar necesariamente basado en, pero podrfa incluir, un aspecto dependiente del tiempo. Dado que el esquema se dirige por elementos/eventos, diversas caracteristicas de audio (es decir, tempo, tiempos, compases, sincronicidad en tiempo real, eventos audibles, eventos emocionales, etc.) podrfan representarse de una manera mas objetiva y, por lo tanto, manipularse de manera similar con respecto a los componentes basicos de la composicion sonora. En algunos aspectos, las indicaciones unicas mencionadas anteriormente que pueden incluirse como parte de los datos externos pueden evitar la manipulacion de la representacion MSML por cualquier persona que no sea el usuario. En otros aspectos, las indicaciones unicas pueden servir para identificar al usuario (es decir, el usuario particular que tiene el derecho a la representacion MSML particular) en los casos en que dicho archivo es copiado, transferido o distribuido de otra manera por el usuario. Tal caracterfstica puede, en algunos casos, limitar o eliminar la copia, el intercambio de archivos o de otro modo el uso no autorizado de la representacion MSML particular del archivo de audio digital original. En otros casos, una caracterfstica de este tipo puede servir como un mecanismo para "rastrear" al usuario, incluyendo, por ejemplo, habitos o tendencias de compra, datos demograficos, o uso de los datos (y tendencias de uso), o como un mecanismo para dirigir facturas al usuario para la compra, uso autorizado, o acceso permitido a la representacion MSML. Por consiguiente, las indicaciones unicas pueden, en algunos casos, funcionar dentro del espacio de formato MSML para proporcionar archivos de datos rastreables que pueden atribuirse al usuario particular que tiene ciertos derechos sobre el mismo, en donde dicha funcionalidad puede facilitar una mayor eficiencia e ingresos seguros para el propietario del contenido limitando o disuadiendo de otro modo la redistribucion no autorizada del archivo de datos, ya sea en formato MSML o no. Por consiguiente, una representacion MSML puede configurarse para extraer una huella digital de sonido unica de una senal de audio analogica que, junto con el adorno de datos inaudible, puede proporcionar un metodo altamente eficaz y seguro de identificacion y trazabilidad de medios digitales, sin tener en cuenta o dependiendo de las transformaciones de formato y metodos de entrega.
Muchas modificaciones y otros aspectos de las descripciones expuestas en el presente documento le vendran a la mente a un experto en la tecnica a la que pertenecen estas descripciones que se benefician de las ensenanzas presentadas en las descripciones anteriores y los dibujos asociados. Por ejemplo, los aspectos descritos en el presente documento pueden, en algunos casos, denominarse como una indicacion de un formato de datos digital multifuncional configurado para un almacenamiento altamente compacto y eficaz y una reproduccion de cualquier material representado en forma de una senal de alta fidelidad de base o construccion armonica (incluyendo musica, voz y otros medios basados en sonido ricos), con un procesamiento agregativo eficiente simultaneo y oportunamente sincronizado de informacion relativa y relacionada con la senal y su entrega en red rastreable, optimizada dinamicamente en una infraestructura de IP movil y terrestre. Dichos archivos multimedia pueden ser capaces de transportar simultaneamente y extraer dinamicamente representaciones de senales tanto planas como volumetricas en alta definicion (incluyendo, por ejemplo, estereo 2.0 y sonido envolvente 5.1) y en un solo archivo de datos a una tasa de bits baja (es decir, un solo archivo de datos que tiene una cantidad de informacion reducida), y tambien puede ser capaz de extraer en tiempo real una voz cantada, con una calidad de sonido totalmente transparente y reproducible de la fuente de sonido original (es decir, con alta calidad de informacion). Dichas capacidades pueden reducir significativamente los gastos relacionados con el almacenamiento digital, la difusion, la transmision y el ancho de banda de los sistemas de centralidad mediatica y redes, al mismo tiempo que se abren nuevas fuentes de ingresos y aumenta la monetizacion del contenido. A este respecto, dichos medios pueden configurarse para extraer una huella digital de sonido unica de la senal analogica que, junto con el adorno de datos inaudible, puede proporcionar un metodo altamente eficaz y seguro de identificacion y trazabilidad de medios digitales, sin tener en cuenta o dependiendo de las transformaciones de formato y metodos de entrega. Dichos medios tambien pueden configurarse para incluir un canal de datos dedicado integrado y mezclado con la senal armonica para reflejar dinamicamente y mostrar informacion interestructural de la senal en el dominio del tiempo o dominio de tiempo-frecuencia, permitiendo de este modo la reproduccion sincronizada de audio con cualquier evento exterior o externo (en donde un evento de este tipo puede incluir, por ejemplo, video o una secuencia de programacion en un juego o pelicula, letras de canciones, portadas, credenciales del artista y el compositor o partituras, diversos efectos especiales visuales y pirotecnicos que incluyen iluminacion interior y exterior o audiolibros visuales, publicidad dirigida o cualquier otra informacion relacionada con los medios de sonido reproducidos) mediante una interaccion de datos bidireccional. El canal de datos aumenta sustancialmente la informatividad (es decir, el valor de la informacion) y la personalizacion de los medios recibidos, mejorando de este modo sustancialmente el valor de entretenimiento y la monetizacion de los mismos.
Ademas de los metodos descritos en el presente documento, un experto en la tecnica tambien apreciara que los metodos descritos pueden incorporarse en un ejecutable mediante dispositivos y sistemas apropiados tales como, por ejemplo, diversos dispositivos capaces de cooperar a traves de los procesadores correspondientes u otros dispositivos informaticos y de comunicacion, en donde dichos dispositivos pueden asociarse con disposiciones particulares de memoria o almacenamiento cuando sea necesario, se desee y/o sea apropiado. Un experto en la tecnica apreciara ademas que los metodos descritos pueden incorporarse en al menos un medio de almacenamiento legible por ordenador que tiene partes de codigo de programa legibles por ordenador almacenadas en el mismo que, en respuesta a la ejecucion por un procesador, hacen que un aparato realice al menos los metodos descritos. Por lo tanto, se entendera que las descripciones no deben limitarse a los aspectos especificos descritos y que se pretende que las modificaciones y otros aspectos se incluyan dentro del alcance de las reivindicaciones adjuntas. Aunque se emplean terminos especificos en el presente, se usan solo en un sentido generico y descriptivo y no con fines limitativos.

Claims (19)

REIVINDICACIONES
1. Un metodo para estructurar informacion que comprende informacion digital, comprendiendo dicho metodo: analizar un archivo de informacion digital original para determinar cuantos elementos de datos se incluyen en el archivo de informacion digital, y un valor de informacion original asociado con cada elemento de datos de este tipo, y por lo tanto una cantidad de informacion original y un valor de informacion original asociados con el archivo de informacion digital original;
aplicar un proceso de manipulacion inicial al archivo de informacion digital original para formar un primer archivo de informacion digital resultante, y aplicar un proceso de manipulacion posterior al primer archivo de informacion digital resultante para formar un segundo archivo de informacion digital resultante, estando cada proceso de manipulacion configurado para, al menos uno de, eliminar al menos un elemento del archivo de informacion digital procesado, y representar una combinacion de una pluralidad de elementos del archivo de informacion digital procesado con un elemento representativo y una primera indicacion asociada con una interrelacion entre el elemento representativo y al menos uno de la pluralidad de elementos en la combinacion, para reducir la cantidad de informacion de, y para estructurar el archivo de informacion digital procesado, estando el al menos uno del elemento eliminado y el elemento representativo determinados para reducir el valor de informacion del archivo de informacion digital procesado en no mas que un umbral seleccionado; y
aplicar sucesivamente procesos de manipulacion al archivo de informacion digital previamente resultante hasta que las aplicaciones de proceso de manipulacion sucesivas no logren una reduccion de umbral en la cantidad de informacion en el archivo de informacion digital resultante posterior sobre el archivo de informacion digital previamente resultante, teniendo de este modo el ultimo archivo de informacion digital resultante un estructura primaria con una cantidad de informacion reducida con respecto a la cantidad de informacion original y un valor de informacion resultante dentro del umbral seleccionado del valor de informacion original.
2. Un metodo de acuerdo con la reivindicacion 1, en el que la aplicacion sucesiva de procesos de manipulacion comprende ademas la aplicacion sucesiva de procesos de manipulacion al archivo de informacion digital previamente resultante para formar el ultimo archivo de informacion digital estructurada resultante configurado de acuerdo con una jerarqufa de informacion que tiene una pluralidad de niveles de informacion.
3. Un metodo de acuerdo con la reivindicacion 2, en el que un nivel de informacion superior de la jerarqufa de informacion incluye una cantidad de informacion mas pequena que un nivel de informacion inferior, y en el que el metodo comprende ademas uno de:
formar el nivel de informacion superior a partir de una estructura del nivel de informacion inferior y los parametros caoticos asociados con el mismo;
formar el nivel de informacion superior de modo que el nivel de informacion superior incluya un valor de informacion superior que el valor de informacion original; y
formar una pluralidad de niveles de informacion inferiores a partir de una estructura del nivel de informacion superior, y seleccionar uno de la pluralidad de niveles de informacion inferiores para la asociacion con el nivel de informacion superior.
4. Un metodo de acuerdo con la reivindicacion 1, que comprende ademas aplicar simultaneamente una pluralidad de procesos de manipulacion a un archivo de informacion digital anterior para formar un archivo de informacion digital estructurado secundario, en particular que comprende analizar los archivos de informacion digital estructurados primarios y secundarios para determinar al menos una de una interrelacion entre los niveles de informacion dentro de uno de los archivos de informacion digital estructurados primarios y secundarios, y una interrelacion entre los archivos de informacion digital estructurados primarios y secundarios.
5. Un metodo de acuerdo con la reivindicacion 1, que comprende ademas aplicar al menos uno de una pluralidad de procesos de manipulacion a un archivo de informacion digital anterior, estando los procesos de manipulacion seleccionados del grupo que consiste en un proceso de manipulacion de codificacion sin fases, un proceso de manipulacion de analisis estructurado para estructuras repetitivas, un proceso de manipulacion de codificacion de repeticion sin fases, un metodo de manipulacion de compresion de entropfa sin perdidas, un proceso de manipulacion de acelerador sin perdidas para formar una capa de compresion adicional para un archivo de datos de audio previamente reducido, un proceso de manipulacion de acelerador para facilitar la transmision eficiente de datos de audio, y un proceso de manipulacion de codificacion de transformada affn.
6. Un metodo de acuerdo con la reivindicacion 1, en el que aplicar sucesivamente procesos de manipulacion para obtener un valor de informacion resultante dentro del umbral seleccionado del valor de informacion original comprende ademas aplicar sucesivamente procesos de manipulacion para obtener un valor de informacion resultante dentro del umbral seleccionado, que comprende un lfmite de percepcion humana, del valor de informacion original para preservar la fidelidad del archivo de informacion digital estructurado primario.
7. Un metodo de acuerdo con la reivindicacion 1, en el que la formacion de los archivos de informacion digital resultantes, comprende ademas formar los archivos de informacion digital resultantes de tal forma que cada archivo de informacion digital resultante comprende un conjunto de objetos y agrupaciones de objetos, teniendo cada objeto y agrupacion de objetos una definicion respectiva.
8. Un metodo de acuerdo con la reivindicacion 1, en el que aplicar un proceso de manipulacion para, al menos uno de, eliminar al menos un elemento del archivo de informacion digital procesada, y representar una combinacion de una pluralidad de elementos del archivo de informacion digital procesada con un elemento representativo, comprende ademas la aplicacion de un proceso de manipulacion para, al menos uno de, eliminar al menos un elemento del archivo de informacion digital procesado, y representar una combinacion de una pluralidad de elementos del archivo de informacion digital procesada con un elemento representativo, una primera indicacion asociada con un interrelacion entre el elemento representativo y al menos uno de la pluralidad de elementos en la combinacion, y una segunda indicacion asociada con una interrelacion entre al menos dos de la pluralidad de elementos en la combinacion, en particular en donde la formacion de los archivos de informacion digital resultantes comprende ademas formar los archivos de informacion digital resultantes de tal forma que los objetos y las agrupaciones de objetos en los mismos comprenden al menos uno de los elementos representativos, y de tal forma que la definicion asociada con cada objeto y agrupacion de objetos comprenda la primera indicacion de interrelacion y, opcionalmente, la segunda indicacion de interrelacion, asociadas con el al menos uno de los elementos representativos, en particular comprendiendo ademas uno de:
incluyendo las definiciones con el conjunto correspondiente de objetos y agrupaciones de objetos en cada archivo de informacion digital resultante; y
mantener las definiciones asociadas con el conjunto de objetos y agrupaciones de objetos por separado de cada archivo de informacion digital resultante correspondiente.
9. Un metodo de acuerdo con la reivindicacion 1, en el que la formacion de los archivos de informacion digital resultantes, comprende ademas formar los archivos de informacion digital resultantes de manera que cada archivo de informacion digital resultante posterior comprenda cualquier patron reconocido de objetos y agrupaciones de objetos dentro del archivo de informacion digital resultante anterior.
10. Un metodo de acuerdo con la reivindicacion 1, en el que aplicar sucesivamente procesos de manipulacion hasta que las aplicaciones de proceso de manipulacion sucesivas no logren una reduccion de umbral en la cantidad de informacion en el archivo de informacion digital resultante posterior, comprende ademas aplicar sucesivamente procesos de manipulacion hasta que las aplicaciones de proceso de manipulacion sucesivas no logren una reduccion de umbral en la cantidad de informacion en el archivo de informacion digital resultante posterior, de tal forma que el ultimo archivo de informacion digital resultante tenga una estructura de primotron de informacion que comprenda un conjunto de objetos primarios, agrupaciones de objetos primarios, y cualquier interrelacion asociada los mismos, en particular que comprenda analizar cada archivo de informacion digital resultante y el ultimo archivo de informacion digital resultante para determinar las correlaciones estadfsticas entre los objetos posteriores en un archivo de informacion digital posterior y las combinaciones de objetos anteriores en un archivo de informacion digital anterior y, para cualquier correlacion estadfstica que cumpla al menos un umbral de correspondencia, almacenar una indicacion de correlacion del objeto posterior correspondiente y una combinacion anterior de objetos para el analisis de un archivo de informacion digital original posterior.
11. Un metodo de acuerdo con la reivindicacion 10, que comprende ademas uno de:
analizar cada archivo de informacion digital resultante sucesivo para determinar al menos una correlacion objetiva entre una combinacion de objetos anteriores, y al menos una relacion entre objetos entre los objetos anteriores en la combinacion, en un archivo de informacion digital anterior y asociar la al menos una correlacion objetiva y la al menos una relacion entre objetos con un objeto posterior correspondiente en un archivo de informacion digital posterior, la al menos una correlacion objetiva y la al menos una relacion entre objetos asociada con el objeto posterior correspondiente, sobre una pluralidad de objetos posteriores, formando colectivamente un conjunto de correlaciones de objetos representativas de las interrelaciones asociadas con el conjunto de objetos primarios y agrupaciones de objetos primarios en la estructura de primotron de informacion; y
analizar cada archivo de informacion digital resultante sucesivo para determinar al menos una correlacion objetiva entre una combinacion de objetos anteriores en un archivo de informacion digital anterior, y asignar al menos una relacion entre objetos entre los objetos anteriores en la combinacion, y asociar la al menos una correlacion objetiva y la al menos una relacion entre objetos con un objeto posterior correspondiente en un archivo de informacion digital posterior, la al menos una correlacion objetiva y la al menos una relacion entre objetos asociada con el objeto posterior correspondiente, sobre una pluralidad de objetos posteriores, formando colectivamente un conjunto de correlaciones de objetos representativas de las interrelaciones asociadas con el conjunto de objetos primarios y agrupaciones de objetos primarios en la estructura de primotron de informacion.
12. Un metodo de acuerdo con la reivindicacion 11, que comprende ademas interpretar el conjunto de objetos primarios y la agrupacion de objetos primarios en la estructura de primotron de informacion mediante la evaluacion estadfstica de diversas combinaciones de correlaciones de objetos en el conjunto de correlaciones de objetos y, para cualquier combinacion de correlaciones de objetos, cumplir al menos con un umbral estadfstico, asociar las combinaciones con los objetos primarios y agrupaciones de objetos primarios como una interpretacion contextual del conjunto de objetos primarios y agrupaciones de objetos primarios en la estructura de primotron de informacion, que en particular comprende ademas sintetizar un archivo de informacion digital representativo asociado con el archivo de informacion digital original aplicando la interpretacion contextual al conjunto de objetos primarios y agrupaciones de objetos primarios en la estructura de primotron de informacion.
13. Un metodo de acuerdo con la reivindicacion 11, que comprende, ademas:
asociar al menos un objeto, estando el al menos un objeto seleccionado de los objetos anteriores, los objetos posteriores, y los objetos primarios y las agrupaciones de objetos primarios, con una de una pluralidad de caracterfsticas del archivo de informacion digital original; y
determinar una disposicion de la pluralidad de caracterfsticas con respecto a la duracion del archivo de informacion digital original y correlacionar una distribucion del al menos un objeto con respecto al mismo, en particular que comprende formar un archivo de datos de resumen que incluye una representacion generalizada de la distribucion de al menos un objeto asociado con cada una de la pluralidad de caracterfsticas a lo largo de la duracion del archivo de informacion digital original.
14. Un metodo de acuerdo con la reivindicacion 10, en el que aplicar sucesivamente procesos de manipulacion hasta que las sucesivas aplicaciones de proceso de manipulacion no logren una reduccion de umbral en la cantidad de informacion en el archivo de informacion digital resultante posterior, comprende ademas la catalogacion de una cantidad y un orden de los procesos de manipulacion aplicados sucesivamente a los archivos de informacion digital resultantes posteriores para obtener el ultimo archivo de informacion digital resultante que tiene la estructura de primotron de informacion, estando la cantidad de procesos de manipulacion asociados con los niveles correspondientes de una jerarqufa de informacion.
15. Un metodo de acuerdo con la reivindicacion 10, 12 y 14, que comprende ademas sintetizar un archivo de informacion digital representativo asociado con el archivo de informacion digital original de acuerdo con un proceso condicional que comprende:
aplicar cualquier indicacion de correlacion aplicable al conjunto de objetos primarios y agrupaciones de objetos primarios en la estructura de primotron de informacion para determinar la combinacion anterior correspondiente de objetos asociados con los mismos;
si no se determina ninguna indicacion de correlacion aplicable, aplicar la interpretacion contextual al conjunto de objetos primarios y agrupaciones de objetos primarios en la estructura de primotron de informacion para determinar la combinacion anterior correspondiente de objetos asociados con los mismos; y
si la aplicacion de la interpretacion contextual esta por debajo de un valor de informacion de umbral asociado con el valor de informacion original, aplicar un proceso de manipulacion inverso inicial al conjunto de objetos primarios y agrupaciones de objetos primarios en la estructura de primotron de informacion, siendo el proceso de manipulacion inverso inicial la primera manipulacion en el orden inverso de los procesos de manipulacion, para determinar la combinacion anterior correspondiente de objetos asociados con el mismo, comprendiendo en particular ademas, para la combinacion anterior de objetos determinada a partir del conjunto de objetos primarios y agrupaciones de objetos primarios en la estructura de primotron de informacion, aplicar al mismo, el proceso condicional que incluye cualquier indicacion de correlacion aplicable, la interpretacion contextual correspondiente o el siguiente proceso de manipulacion inversa en el orden inverso de los procesos de manipulacion correspondientes a la combinacion anterior de objetos, con el fin de determinar la siguiente combinacion anterior de objetos correspondientes al mismo, que comprende en particular ademas aplicar sucesivamente el proceso condicional a la siguiente combinacion anterior de objetos hasta que la combinacion anterior resultante de objetos se asocie con el nivel inicial de la jerarqufa de informacion, correspondiendo asf el archivo de informacion digital anterior resultante al archivo de informacion digital representativo sintetizado.
16. Un metodo de acuerdo con la reivindicacion 1, en el que el archivo de informacion digital original es un archivo de audio digital, y el metodo comprende ademas asociar una cantidad de informacion del archivo de audio digital con una tasa de bits proporcional a un tamano y una duracion de tiempo del archivo de audio digital, y asociar un valor de informacion del archivo de audio digital con una calidad del archivo de audio digital, siendo la calidad determinada a partir de al menos uno de un valor de umbral de energfa de primotron, un criterio de informacion perceptiva (PIC), una estructura de sonido identificada a partir de un evento de fluctuacion de caos aleatorio determinado de acuerdo con una funcion de distribucion de probabilidad que usa ruido aleatorio como senal de entrada, un criterio de perdida de calidad nula, y un area de superficie de una esfera n-dimensional de un radio de unidad unica en un dominio de frecuencia de tiempo determinado a partir de una funcion implfcita, en particular, en donde la aplicacion sucesiva de procesos de manipulacion al archivo de audio digital previamente resultante para formar el ultimo archivo de musica digital estructurado resultante comprende ademas la aplicacion sucesiva de procesos de manipulacion al archivo de audio digital previamente resultante para formar el ultimo archivo de audio digital estructurado resultante configurado de acuerdo con una jerarqufa de informacion que tiene una pluralidad de niveles de informacion, en donde un nivel de informacion inferior comprende una representacion del audio como un archivo de informacion digital de alta resolucion, y un nivel de informacion superior comprende una representacion en ficha que incluye una puntuacion de nota escrita con las letras correspondientes, teniendo asf el nivel de informacion superior una cantidad de informacion mas pequena que el nivel de informacion inferior, y siendo de este modo el nivel de informacion inferior capaz de formarse a partir del nivel de informacion superior y los parametros caoticos asociados con el rendimiento y la digitalizacion del audio de acuerdo con la representacion en ficha, en particular en donde la aplicacion sucesiva de procesos de manipulacion al archivo de audio digital previamente resultante para formar el ultimo archivo de musica digital estructurado resultante comprende ademas aplicar sucesivamente procesos de manipulacion al archivo de audio digital previamente resultante para formar el ultimo archivo de audio digital estructurado resultante que comprende al menos un primotron definido en uno de un dominio del tiempo y un dominio del tiempo-frecuencia, representando el ultimo archivo de audio digital estructurado resultante una formalizacion digital compacta de una senal armonica, en donde la cantidad de informacion asociada con la tasa de bits de audio se reduce en comparacion con el archivo de audio digital correspondiente al archivo de informacion digital original, mientras que el valor de informacion asociado con la calidad de audio se mantiene dentro de un umbral del archivo de audio digital correspondiente al archivo de informacion digital original.
17. Un metodo de acuerdo con la reivindicacion 16, en el que cada archivo de audio digital representa datos relacionados con armonicos, y el metodo comprende ademas la definicion de aciertos como estructuras jerarquicas de nivel superior en el dominio del tiempo; la definicion de armonicos como estructuras jerarquicas de nivel superior en el dominio de la frecuencia que tienen un origen de primotron armonico posterior que coincide con una terminacion de primotron armonico anterior; la eliminacion de la redundancia en las estructuras jerarquicas de nivel inferior de dominio del tiempo para obtener una disminucion de la entropfa en las estructuras jerarquicas de nivel superior; y la definicion de sobretonos como estructuras jerarquicas de nivel superior de dominio de la frecuencia que tienen una frecuencia base unica correspondiente a las estructuras jerarquicas de nivel inferior y una pluralidad de copias de las estructuras jerarquicas de nivel superior desplazadas una frecuencia fija de la frecuencia base unica y entre sf.
18. Un sistema para estructurar informacion, que comprende al menos un dispositivo de analisis, teniendo cada uno un procesador; al menos un dispositivo de reduccion de archivos digitales, teniendo cada uno un procesador; y opcionalmente un dispositivo de sintetizacion que tiene un procesador; estando los dispositivos configurados para cooperar para realizar al menos el metodo de acuerdo con una cualquiera de las reivindicaciones 1-17.
19. Un medio de almacenamiento legible por ordenador que tiene partes de codigo de programa legibles por ordenador almacenadas en el mismo que, en respuesta a la ejecucion por parte de un procesador, hace que un aparato realice al menos el metodo de acuerdo con una cualquiera de las reivindicaciones 1-17.
ES12825060T 2011-08-19 2012-08-16 Método de formalización y estructuración de información multinivel y multiestructural y aparato asociado Active ES2712131T3 (es)

Applications Claiming Priority (3)

Application Number Priority Date Filing Date Title
US201161525629P 2011-08-19 2011-08-19
US201261588101P 2012-01-18 2012-01-18
PCT/CA2012/050562 WO2013026155A1 (en) 2011-08-19 2012-08-16 Multi-structural, multi-level information formalization and structuring method, and associated apparatus

Publications (1)

Publication Number Publication Date
ES2712131T3 true ES2712131T3 (es) 2019-05-09

Family

ID=47745816

Family Applications (1)

Application Number Title Priority Date Filing Date
ES12825060T Active ES2712131T3 (es) 2011-08-19 2012-08-16 Método de formalización y estructuración de información multinivel y multiestructural y aparato asociado

Country Status (8)

Country Link
US (2) US9501494B2 (es)
EP (1) EP2745211B8 (es)
JP (1) JP6181651B2 (es)
CN (1) CN104011792B (es)
CA (1) CA2845731C (es)
ES (1) ES2712131T3 (es)
RU (1) RU2612603C2 (es)
WO (1) WO2013026155A1 (es)

Families Citing this family (15)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
RU2612603C2 (ru) * 2011-08-19 2017-03-09 Александр ЖИРКОВ Способ многоструктурных, многоуровневых формализации и структурирования информации и соответствующее устройство
US9514197B2 (en) * 2013-03-01 2016-12-06 Ebay Inc. System and method of selecting events or locations based on content
US9263013B2 (en) * 2014-04-30 2016-02-16 Skiptune, LLC Systems and methods for analyzing melodies
CN107077849B (zh) * 2014-11-07 2020-09-08 三星电子株式会社 用于恢复音频信号的方法和设备
EP3035692B1 (en) * 2014-12-19 2020-11-04 Vodafone Holding GmbH Method of adapting a network readiness for downloading video data
US9583113B2 (en) * 2015-03-31 2017-02-28 Lenovo (Singapore) Pte. Ltd. Audio compression using vector field normalization
US10452710B2 (en) 2015-09-30 2019-10-22 Microsoft Technology Licensing, Llc Selecting content items based on received term using topic model
CN107924683B (zh) * 2015-10-15 2021-03-30 华为技术有限公司 正弦编码和解码的方法和装置
EP3333782A1 (en) * 2016-12-09 2018-06-13 The Boeing Company Electronic device and method for debriefing evidence-based training sessions
CN106990287B (zh) * 2017-05-08 2019-07-19 集美大学 一种电力系统谐波检测器部署方法
CN107770596A (zh) * 2017-09-25 2018-03-06 北京达佳互联信息技术有限公司 一种特效同步方法、装置及移动终端
US11157807B2 (en) * 2018-04-14 2021-10-26 International Business Machines Corporation Optical neuron
CN108766448B (zh) * 2018-06-19 2020-05-01 苏州科达科技股份有限公司 混音测试系统、方法、装置及存储介质
US20220122594A1 (en) * 2020-10-21 2022-04-21 Qualcomm Incorporated Sub-spectral normalization for neural audio data processing
US11223552B1 (en) * 2021-01-08 2022-01-11 Microsoft Technology Licensing, Llc Aggregation-based determination of cloud computing service resiliency to chaos events

Family Cites Families (10)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US5748763A (en) * 1993-11-18 1998-05-05 Digimarc Corporation Image steganography system featuring perceptually adaptive and globally scalable signal embedding
WO1995017745A1 (en) * 1993-12-16 1995-06-29 Voice Compression Technologies Inc. System and method for performing voice compression
CN1106085C (zh) * 1996-04-26 2003-04-16 德国汤姆逊-布朗特公司 对数字音频信号编码的方法和装置
US6178405B1 (en) 1996-11-18 2001-01-23 Innomedia Pte Ltd. Concatenation compression method
FR2756399B1 (fr) * 1996-11-28 1999-06-25 Thomson Multimedia Sa Procede et dispositif de compression video pour images de synthese
US6223162B1 (en) * 1998-12-14 2001-04-24 Microsoft Corporation Multi-level run length coding for frequency-domain audio coding
KR100917464B1 (ko) 2003-03-07 2009-09-14 삼성전자주식회사 대역 확장 기법을 이용한 디지털 데이터의 부호화 방법,그 장치, 복호화 방법 및 그 장치
JP4978539B2 (ja) * 2008-04-07 2012-07-18 カシオ計算機株式会社 符号化装置、符号化方法及びプログラム。
JP5519230B2 (ja) * 2009-09-30 2014-06-11 パナソニック株式会社 オーディオエンコーダ及び音信号処理システム
RU2612603C2 (ru) * 2011-08-19 2017-03-09 Александр ЖИРКОВ Способ многоструктурных, многоуровневых формализации и структурирования информации и соответствующее устройство

Also Published As

Publication number Publication date
US10140305B2 (en) 2018-11-27
CA2845731A1 (en) 2013-02-28
HK1201631A1 (en) 2015-09-04
US20140164454A1 (en) 2014-06-12
CA2845731C (en) 2019-10-29
JP2014529755A (ja) 2014-11-13
RU2612603C2 (ru) 2017-03-09
EP2745211B8 (en) 2019-07-17
CN104011792B (zh) 2018-08-24
EP2745211A4 (en) 2015-07-08
EP2745211B1 (en) 2018-12-19
RU2014106938A (ru) 2015-09-27
WO2013026155A1 (en) 2013-02-28
CN104011792A (zh) 2014-08-27
EP2745211A1 (en) 2014-06-25
US20170031935A1 (en) 2017-02-02
US9501494B2 (en) 2016-11-22
JP6181651B2 (ja) 2017-08-16

Similar Documents

Publication Publication Date Title
US10140305B2 (en) Multi-structural, multi-level information formalization and structuring method, and associated apparatus
CN106486128B (zh) 一种双音源音频数据的处理方法及装置
US10832693B2 (en) Sound synthesis for data sonification employing a human auditory perception eigenfunction model in Hilbert space
CN109147831A (zh) 一种语音连接播放方法、终端设备及计算机可读存储介质
CN111816202A (zh) 一种带有人声的音乐的风格迁移方法
CN117672241A (zh) 歌曲音色转换方法、计算机设备和存储介质
CN119517054B (zh) 歌声特征转换方法、电子设备、存储介质
CN119673185B (zh) 歌声转换模型训练方法、歌曲音色转换方法及相关产品
ES2366551T3 (es) Codificación y decodificación dependiente de una fuente de múltiples libros de códigos.
Sharma Audio Texture Analysis of Biomedical Audio Signals
Concialdi Ainur: Enhancing Vocal Quality through Lyrics-Audio Embeddings in Multimodal Deep Music Generation
Javadi Timbre Transfer in the Latent Space of Descript Audio Codec: Transforming Beatbox Performances Into Acoustic Drum Kit Recordings
HK1201631B (zh) 多结构的、多级信息形式化和结构化方法和相关联的装置
Rossi et al. Communicating Sound Through Natural Language
Smith Wordless Syntax and Holarchic Flux in Terrain
Kersten Statistical modelling and resynthesis of environmental texture sounds
Roebel From Noise to Singing-Deep Neural Networks for Music Generation
Wang Unsupervised Bayesian Musical Key and Chord Recognition
Murthy et al. Computational Aspects of Classical Music
CN117746832A (zh) 歌声合成方法、装置、计算机设备和存储介质
HK40075669A (en) Method and apparatus for training song synthesis model, song synthesis method and apparatus
CN120496566A (zh) 音频转谱方法、装置、计算机设备、存储介质和程序产品
Merz Method for simulating creativity to generate sound collages from documents on the web
Yu et al. Context adaptive training with factorized decision trees for HMM-based speech synthesis
Whalley International Computer Music Conference 2004