C'è un nome migliore di "media dell'integrale"?


12

Sto testando i sensori di posizione della valvola a farfalla (TPS) che la mia azienda vende e stampo il diagramma della risposta in tensione alla rotazione dell'albero a farfalla. Un TPS è un sensore rotazionale con 90 ° di portata e l'uscita è come un potenziometro con apertura completa pari a 5 V (o il valore di ingresso del sensore) e l'apertura iniziale con un valore compreso tra 0 e 0,5 V. Ho costruito un banco di prova con un controller PIC32 per eseguire una misurazione della tensione ogni 0,75 ° e la linea nera collega queste misurazioni.

Uno dei miei prodotti ha la tendenza a rendere le variazioni localizzate, a bassa ampiezza, lontano dalla (e sotto) la linea ideale. Questa domanda riguarda il mio algoritmo per quantificare questi "tuffi" localizzati; qual è un buon nome o una descrizione per il processo di misurazione dei tuffi? (la spiegazione completa segue) Nell'immagine seguente, il calo si verifica al terzo sinistro della trama ed è un caso marginale se vorrei passare o fallire questa parte:

Stampa da una parte sospetta

Così ho costruito un rilevatore di dip ( stackoverflow qa sull'algoritmo ) per quantificare la mia sensazione di intestino. Inizialmente pensavo di misurare "area". Questo grafico si basa sulla stampa sopra e sul mio tentativo di spiegare graficamente l'algoritmo. C'è un tuffo della durata di 13 campioni tra 17 e 31:

Dati campionati mostrati con il "calo" ingrandito

I dati di test vanno in un array e io creo un altro array per "salire" da un punto dati all'altro, che io chiamo . Uso una libreria per ottenere la deviazione media e standard per i .d e l t a sdeltasdeltas

L'analisi dell'array è rappresentata nel grafico seguente, in cui la pendenza viene rimossa dal grafico sopra. Inizialmente, ho pensato a questo come a "normalizzare" o "unitizzare" i dati in quanto l'asse x sono passi uguali e ora sto solo lavorando con l'aumento tra i punti di dati. Durante la ricerca di questa domanda, ho ricordato che questo è il derivato, dei dati originali.d ydeltasdydx

Analisi del derivato ...?

Cammino tra i per trovare sequenze in cui ci sono 5 o più valori negativi adiacenti. Le barre blu sono una serie di punti dati che sono al di sotto della media di tutti i . I valori delle barre blu sono:d e l t a sdeltasdeltas

0.7+1.2+1.3+1.4+1.8+2.5+2.9+3.0+2.5+2.0+1.5+1.0+1.2

Sommano a , che rappresenta l'area (o l'integrale). Il mio primo pensiero è "Ho appena integrato la derivata", il che dovrebbe significare che ho recuperato i dati originali, anche se sono certo che ci sia un termine per questo.23

La linea verde è la media di questi "valori sotto la media" trovati dividendo l'area per la lunghezza del tuffo:

23÷13=1.77

Durante il collaudo di oltre 100 parti, sono arrivato a decidere che i decadimenti con la mia linea verde in media inferiore a sono accettabili. La deviazione standard calcolata sull'intero set di dati non è stata una prova abbastanza rigorosa per questi avvallamenti, poiché senza una superficie totale sufficiente, rientravano ancora nel limite stabilito per le parti valide. Ho scelto osservativamente la deviazione standard di come la più alta che avrei permesso.3.02.63.0

Impostare un limite per la deviazione standard abbastanza rigoroso per fallire questa parte sarebbe quindi così rigoroso da non riuscire a parti che altrimenti sembrano avere un grande diagramma. Ho anche un rilevatore di picchi che non riesce la parte se .|deltasavg|>avg+stddev

Sono passati quasi 20 anni da Calc 1, quindi per favore, andate piano con me, ma è molto simile a quando un professore ha usato il calcolo e l'equazione di spostamento per spiegare come nelle corse, un concorrente con meno accelerazione che mantiene una maggiore velocità in curva può battere un altro concorrente che ha una maggiore accelerazione alla svolta successiva: andando più veloce nella curva precedente, la velocità iniziale più alta significa che l'area sotto la sua velocità (spostamento) è maggiore.

Per tradurre questo alla mia domanda, sento che la mia linea verde sarebbe come l'accelerazione, la seconda derivata dei dati originali.

Ho visitato Wikipedia per rileggere i fondamenti del calcolo e le definizioni di derivato e integrale , ho imparato il termine appropriato per sommare l'area sotto una curva tramite misurazioni discrete come integrazione numerica . Molto più googling in media dell'integrale e sto conducendo al tema della non linearità e dell'elaborazione del segnale digitale. La media dell'integrale sembra essere una metrica popolare per la quantificazione dei dati .

Esiste un termine per la media dell'integrale? ( , la linea verde)? 1.77
... o per il processo di utilizzo per valutare i dati?


Penso che il "tuffo medio" sia abbastanza buono. Non ha le dimensioni dell'accelerazione, quindi sicuramente non ha nulla a che fare con quello.
ShreevatsaR

E apprezzerei qualsiasi osservazione o commento su questo argomento nel suo insieme. Sono un po 'turbato dal modo in cui questa misurazione del "sentimento intestinale" non è meglio espressa matematicamente.
Chris K,

Potresti eventualmente aggiungere tutti i punti dati che hai usato per costruire la linea ideale, o aggiungere un po 'più informazioni su come viene calcolata la linea rossa tratteggiata per giustificare che le barre blu siano i "delta che sono al di sotto della media di tutti i punti dati "? Se è moralmente la distanza media dalla media, allora dovrebbe esserci un nome stile di accelerazione per esso, che sostituisce naturalmente la differenziazione con il prendere una media.

1
Migrato da Math.SE su richiesta OP: meta.stats.stackexchange.com/questions/1845/…
Willie Wong

1
Potrei aggiungere la parola "locale" per chiarire che esiste il passaggio 1 - Sono d'accordo con @Glen_b (un altro Glen - ciao!) Che questo è importante. Quindi suggerirei provvisoriamente "difetto medio locale" in cui ho appena concatenato la "deviazione dall'ideale" al "difetto". Sembra adatto
Glen Wheeler,

Risposte:


3

Prima di tutto, questa è un'ottima descrizione del tuo progetto e del problema. E sono un grande fan del tuo framework di misurazione fatto in casa, che è super cool ... quindi perché mai importa cosa chiami "calcolo della media degli integrali"?

Nel caso in cui tu sia interessato ad un posizionamento più ampio del tuo lavoro, ciò che vorresti fare viene spesso definito rilevamento di anomalie . Nella sua impostazione più semplice implica il confronto di un valore in una serie temporale con la deviazione standard dei valori precedenti. La regola è quindi se dove è il valore nel valore serie, è la deviazione standard di tutti i valori precedenti tra il valore e e

x[n]>αSD(x[1:n1])=>x[n] is outlier
x[n]nthSD(x[1:n1])1st(n1)thαè un parametro adatto che scegli, come 1 o 2, a seconda della sensibilità che desideri che il rivelatore sia. Ovviamente puoi adattare questa formula per lavorare solo localmente (su un intervallo di lunghezza ), h
x[n]>αSD(x[nh1:n1])=>x[n] is outlier

Se ho capito bene, stai cercando un modo per automatizzare il test dei tuoi dispositivi, ovvero dichiarare un dispositivo come buono / difettoso dopo aver eseguito l'intero test (disegnato l'intera diagonale). In tal caso, considera semplicemente le formule precedenti come il confronto di con la deviazione standard di tutti i valori.x[n]

Esistono anche altre regole che potresti prendere in considerazione ai fini della classificazione di un dispositivo come difettoso:

  • se qualsiasi deviazione (delta) è maggiore di qualche multiplo della SD di tutti i delta
  • se la somma quadrata delle deviazioni è maggiore di una certa soglia
  • se il rapporto tra la somma dei delta positivi e negativi non è approssimativamente uguale (il che potrebbe essere utile se si preferiscono errori più piccoli in entrambe le direzioni piuttosto che un forte pregiudizio in una sola direzione)

Ovviamente puoi trovare più regole e concatenarle usando la logica booleana, ma penso che tu possa andare molto lontano con le tre sopra.

Ultimo ma non meno importante, una volta impostato, dovrai testare il classificatore (un classificatore è un sistema / modello che associa un input a una classe, nel tuo caso i dati di ciascun dispositivo, su "buono" o " difettoso "). Crea un set di test etichettando manualmente le prestazioni di ciascun dispositivo. Quindi guarda ROC , che sostanzialmente ti dice l'offset tra quanti dispositivi il tuo sistema raccoglie correttamente dai restituiti, in relazione a quanti dispositivi difettosi raccoglie.


Credo che "perché mai importa" è una funzione del tuo nome utente. :) Perché? Stessa ragione per cui esiste una cresta iliaca: abbiamo bisogno di parole per quantificare distintamente tutto ciò che è unico nella vita. Imho, questo QA è un esempio di quanto sia limitato il vocabolario all'interno delle statistiche. Dobbiamo combinare descrittori confusi o contraddittori per ciò che è "alla vista" così semplice.
Chris K,

Hehe, ben individuato signore! :) Se ho omesso qualsiasi iniziativa nella terra del branding creativo, è stato semplicemente perché mi sono sentito obbligato a sostenere l'intraprendenza e la dedizione dei tuoi sforzi e idee piuttosto che a creare etichette vane. Dato che insisti nel nominare la media dell'integrale, fai attenzione che quella che consideri la "media dell'integrale" è una media semplice dei tuoi delta. E come tale, i tuoi outlier sono semplicemente "deviazioni dalla media", o forse deviazioni dalla media locale. Non vedo abbastanza il vantaggio di pensare negli integrali, a meno che tu non abbia abbastanza punti di campionamento.
significa significato
Utilizzando il nostro sito, riconosci di aver letto e compreso le nostre Informativa sui cookie e Informativa sulla privacy.
Licensed under cc by-sa 3.0 with attribution required.