Introducción a Text Analytics Toolbox
Text Analytics Toolbox™ ofrece algoritmos y visualizaciones para preprocesar, analizar y modelar datos de texto. Los modelos creados con esta toolbox se pueden utilizar en aplicaciones tales como análisis de sentimientos, mantenimiento predictivo y modelado de temas.
| Nombre de la función | Descripción |
|---|---|
wordcloud |
Crea un gráfico de nube de palabras a partir de un modelo de bolsa de palabras o LDA |
wordCloudCounts |
Cuenta palabras para crear una nube de palabras |
textscatter |
Diagrama de dispersión de texto en 2D |
textscatter3 |
Diagrama de dispersión de texto en 3D |
heatmap |
Crea un mapa de calor |
histcounts |
Recuentos por bin del histograma |
discretize |
Agrupa datos en bins o categorías |
Visualizar
Utilice nubes de palabras y diagramas de dispersión de texto para resumir y validar resultados.
| Nombre de la función | Descripción |
|---|---|
readWordEmbedding |
Lee word embeddings de un archivo de texto |
trainWordEmbedding |
Entrena word embeddings |
word2vec/vec2word |
Asocia palabras a vectores de embedding |
ldaModel |
Modelo de asignación latente de Dirichlet (LDA) |
lsaModel |
Modelo de análisis semántico latente (LSA) |
bagOfWords |
Modelo de bolsa de palabras |
fitlda |
Ajusta un modelo de asignación latente de Dirichlet (LDA) |
fitlsa |
Ajusta un modelo de análisis semántico latente (LSA) |
predict |
Predice los principales temas de LDA de documentos |
fitdist |
Ajusta un objeto de distribución de probabilidad a datos |
fitrlinear |
Ajusta un modelo de regresión lineal a datos de alta dimensionalidad |
fitclinear |
Ajusta un modelo de clasificación lineal a datos de alta dimensionalidad |
fitcecoc |
Ajusta modelos multiclase para clasificadores |
| Nombre de la función | Descripción |
|---|---|
extractFileText |
Lee datos de PDF, Microsoft Word y texto sin formato |
textscan |
Lee datos con formato de un archivo de texto o una cadena |
readtable |
Crea una tabla a partir de un archivo |
compose |
Convierte datos en un array de cadenas con formato |
xlsread |
Lee un archivo de hoja de cálculo de Microsoft Excel |
webread |
Lee contenido de un servicio web RESTful |
TabularTextDatastore |
Almacén de datos para archivos de texto tabular |
FileDatastore |
Almacén de datos con lector de archivos personalizado |
SpreadsheetDatastore |
Almacén de datos para archivos de hojas de cálculo |
| Nombre de la función | Descripción |
|---|---|
tokenizedDocument |
Divide documentos en colecciones de palabras |
normalizeWords |
Elimina flexiones de palabras aplicando el algoritmo de Porter |
bagOfWords |
Modelo de bolsa de palabras |
stopWords |
Lista de palabras no significativas |
context |
Busca apariciones de palabras en contexto dentro de documentos |
removeWords |
Elimina palabras seleccionadas de un documento o una bolsa de palabras |
removeLongWords |
Elimina palabras largas de documentos o una bolsa de palabras |
removeShortWords |
Elimina palabras cortas de documentos o una bolsa de palabras |
removeInfrequentWords |
Elimina palabras con bajo recuento de un modelo de bolsa de palabras |
erasePunctuation |
Elimina signos de puntuación de texto y documentos |
| Nombre de la función | Descripción |
|---|---|
str = "Hello, world" |
Declara una variable de cadena |
str = ["Hello","World"] |
Declara un array de cadenas |
str = string(C) |
Convierte un vector de caracteres C en una cadena |
str2double |
Convierte una cadena en números de tipo doble |
strlength |
Devuelve la longitud de cadenas |
isstring |
Determina si la entrada es un array de cadenas |
join |
Combina cadenas |
split |
Divide cadenas de un array de cadenas |
splitlines |
Divide una cadena en los caracteres de nueva línea |
replace |
Busca y sustituye subcadenas en un array de cadenas |
contains |
Determina si una cadena contiene un patrón |
erase |
Elimina subcadenas dentro de cadenas |
extractBetween |
Extrae subcadenas entre indicadores |
extractAfter |
Extrae una subcadena después de una posición especificada |
extractBefore |
Extrae una subcadena antes de una posición especificada |
strcmp |
Compara cadenas |
regexp |
Busca coincidencias de una expresión regular (distingue entre mayúsculas y minúsculas) |