Tu fichero tiene los decimales como puntos y no como comas como tu le
indicas. Te dejo un ejemplo

#---------------------------------------------------------------------------------------------------------------------
setwd(dir="c:/Users/usuario/Desktop/")
library(outliers)
filename<-"timediff.csv"
time<-read.csv(filename, sep=";",header=TRUE,dec=".") # Esto es lo que has
de cambiar
chisq.out.test(time$TimeDiff)


# Ayuda adicional
#---------------------------------------------------------------------
# Si no supones normalidad
#---------------------------------------------------------------------
time.without.outs <- data.frame(row.names= 1:dim(time)[1], dif = time )


x <- boxplot(time.without.outs$TimeDiff,range= 1.5) # Quita los outliers
que se van más de 1.5 rangos itercuartilicios. Puedes poner otro criterio
pero este es el habitual

time.without.outs$out.rg <- F
time.without.outs[ time.without.outs$TimeDiff %in% x$out,]$out.rg <- T #
Localizamos los outliers con la condición elegida

time.without.outs$TimeDiff.without.out.rg <- time.without.outs$TimeDiff
time.without.outs[ time.without.outs$out.rg,]$TimeDiff.without.out.rg <- NA
# Borramos los outliers

#---------------------------------------------------------------------
# Si supones normalidad bien lo puedes hacer así también
#---------------------------------------------------------------------


time.without.outs$out.rg.norm <- F
time.without.outs[ time.without.outs$TimeDiff %in% x$out,]$out.rg.norm <- T
x <- abs(scale(time.without.outs$TimeDiff)) # Normalizamos la variable

time.without.outs$out.rg.norm <- F
time.without.outs[ x >= qnorm(0.995),]$out.rg.norm <- T # Quitmos los datos
que estén alejados 99.5 % en la distro (suponiedo normalidad)

time.without.outs$TimeDiff.without.out.norm <- time.without.outs$TimeDiff
time.without.outs[
time.without.outs$out.rg.norm,]$TimeDiff.without.out.norm <- NA


#---------------------------------------------------------------------
# Si quieres quitar ambos
#---------------------------------------------------------------------

time.without.outs$TimeDiff.without.out.norm.rg <- time.without.outs$TimeDiff
time.without.outs[ time.without.outs$out.rg |
time.without.outs$out.rg.norm,]$TimeDiff.without.out.norm.rg <- NA

summary(time.without.outs)

# Donde

# TimeDiff.without.out.rg Son los datos sin outliers utilizando un criterio
típico cuando no se sabe la distribución de tus datos
# TimeDiff.without.out.norm Son los datos sin outliers asumiendo la
normalidad de tus datos
qqnorm(time.without.outs$TimeDiff.without.out.rg);
qqline(time.without.outs$TimeDiff.without.out.rg, col = 2, lwd = 2)
qqnorm(time.without.outs$TimeDiff.without.out.norm);
qqline(time.without.outs$TimeDiff.without.out.norm, col = 2, lwd =2)

hist(time.without.outs$TimeDiff.without.out.rg)
hist(time.without.outs$TimeDiff.without.out.norm)
ks.test(x= time$TimeDiff, "pnorm", mean(time$TimeDiff), sd(time$TimeDiff))
# A la vista de estos exploratorios yo no lo supondría.
# TimeDiff.without.out.norm.rg  son los datos sin outliers según los dos
criterios

# De todas maneras tienes un valor que yo creo que has introducido mal
max(time.without.outs$TimeDiff) # Este valor es claramente un error de
transcripción de datos.

--

        [[alternative HTML version deleted]]

_______________________________________________
R-help-es mailing list
[email protected]
https://stat.ethz.ch/mailman/listinfo/r-help-es

Responder a