Cheat Sheet

Introducción a Text Analytics Toolbox

Proceso de minería semántica de texto para extraer información latente de varios tipos de documentos

Text Analytics Toolbox™ ofrece algoritmos y visualizaciones para preprocesar, analizar y modelar datos de texto. Los modelos creados con esta toolbox se pueden utilizar en aplicaciones tales como análisis de sentimientos, mantenimiento predictivo y modelado de temas.

Nombre de la función Descripción
wordcloud Crea un gráfico de nube de palabras a partir de un modelo de bolsa de palabras o LDA
wordCloudCounts Cuenta palabras para crear una nube de palabras
textscatter Diagrama de dispersión de texto en 2D
textscatter3 Diagrama de dispersión de texto en 3D
heatmap Crea un mapa de calor
histcounts Recuentos por bin del histograma
discretize Agrupa datos en bins o categorías
Nube de palabras

Visualizar

Utilice nubes de palabras y diagramas de dispersión de texto para resumir y validar resultados.

Aprendizaje no supervisado

Modelar y predecir

Convierta texto en representaciones numéricas empleando modelos de bolsa de palabras o modelos de word embeddings previamente entrenados, y aplique algoritmos especializados de Machine Learning para predicción y modelado de temas.

Nombre de la función Descripción
readWordEmbedding Lee word embeddings de un archivo de texto
trainWordEmbedding Entrena word embeddings
word2vec/vec2word Asocia palabras a vectores de embedding
ldaModel Modelo de asignación latente de Dirichlet (LDA)
lsaModel Modelo de análisis semántico latente (LSA)
bagOfWords Modelo de bolsa de palabras
fitlda Ajusta un modelo de asignación latente de Dirichlet (LDA)
fitlsa Ajusta un modelo de análisis semántico latente (LSA)
predict Predice los principales temas de LDA de documentos
fitdist Ajusta un objeto de distribución de probabilidad a datos
fitrlinear Ajusta un modelo de regresión lineal a datos de alta dimensionalidad
fitclinear Ajusta un modelo de clasificación lineal a datos de alta dimensionalidad
fitcecoc Ajusta modelos multiclase para clasificadores
Nombre de la función Descripción
extractFileText Lee datos de PDF, Microsoft Word y texto sin formato
textscan Lee datos con formato de un archivo de texto o una cadena
readtable Crea una tabla a partir de un archivo
compose Convierte datos en un array de cadenas con formato
xlsread Lee un archivo de hoja de cálculo de Microsoft Excel
webread Lee contenido de un servicio web RESTful
TabularTextDatastore Almacén de datos para archivos de texto tabular
FileDatastore Almacén de datos con lector de archivos personalizado
SpreadsheetDatastore Almacén de datos para archivos de hojas de cálculo
Iconos de PDF, archivos de texto y hojas de cálculo

Importar

Extraiga texto de archivos de Microsoft® Word®, PDF, archivos de texto y hojas de cálculo.

Preprocesamiento de texto

Preprocesar

Elimine artefactos poco útiles, como palabras comunes, signos de puntuación y URL, y aplique normalización de texto para reducir las palabras a su raíz.

Nombre de la función Descripción
tokenizedDocument Divide documentos en colecciones de palabras
normalizeWords Elimina flexiones de palabras aplicando el algoritmo de Porter
bagOfWords Modelo de bolsa de palabras
stopWords Lista de palabras no significativas
context Busca apariciones de palabras en contexto dentro de documentos
removeWords Elimina palabras seleccionadas de un documento o una bolsa de palabras
removeLongWords Elimina palabras largas de documentos o una bolsa de palabras
removeShortWords Elimina palabras cortas de documentos o una bolsa de palabras
removeInfrequentWords Elimina palabras con bajo recuento de un modelo de bolsa de palabras
erasePunctuation Elimina signos de puntuación de texto y documentos
Nombre de la función Descripción
str = "Hello, world" Declara una variable de cadena
str = ["Hello","World"] Declara un array de cadenas
str = string(C) Convierte un vector de caracteres C en una cadena
str2double Convierte una cadena en números de tipo doble
strlength Devuelve la longitud de cadenas
isstring Determina si la entrada es un array de cadenas
join Combina cadenas
split Divide cadenas de un array de cadenas
splitlines Divide una cadena en los caracteres de nueva línea
replace Busca y sustituye subcadenas en un array de cadenas
contains Determina si una cadena contiene un patrón
erase Elimina subcadenas dentro de cadenas
extractBetween Extrae subcadenas entre indicadores
extractAfter Extrae una subcadena después de una posición especificada
extractBefore Extrae una subcadena antes de una posición especificada
strcmp Compara cadenas
regexp Busca coincidencias de una expresión regular (distingue entre mayúsculas y minúsculas)
"Hello,world"

Cadenas

Manipule, compare y almacene datos de texto de manera eficiente.