Devo convertire i dati tra due sistemi.
Il primo sistema archivia le pianificazioni come un semplice elenco di date. Ogni data inclusa nella pianificazione è di una riga. Ci possono essere vari vuoti nella sequenza di date (fine settimana, giorni festivi e pause più lunghe, alcuni giorni della settimana possono essere esclusi dal programma). Non ci possono essere lacune, anche i fine settimana possono essere inclusi. Il programma può durare fino a 2 anni. Di solito dura poche settimane.
Ecco un semplice esempio di un programma che si estende per due settimane esclusi i fine settimana (ci sono esempi più complicati nello script seguente):
+----+------------+------------+---------+--------+
| ID | ContractID | dt | dowChar | dowInt |
+----+------------+------------+---------+--------+
| 10 | 1 | 2016-05-02 | Mon | 2 |
| 11 | 1 | 2016-05-03 | Tue | 3 |
| 12 | 1 | 2016-05-04 | Wed | 4 |
| 13 | 1 | 2016-05-05 | Thu | 5 |
| 14 | 1 | 2016-05-06 | Fri | 6 |
| 15 | 1 | 2016-05-09 | Mon | 2 |
| 16 | 1 | 2016-05-10 | Tue | 3 |
| 17 | 1 | 2016-05-11 | Wed | 4 |
| 18 | 1 | 2016-05-12 | Thu | 5 |
| 19 | 1 | 2016-05-13 | Fri | 6 |
+----+------------+------------+---------+--------+
ID
è unico, ma non è necessariamente sequenziale (è la chiave primaria). Le date sono uniche all'interno di ciascun contratto (c'è un indice univoco attivo (ContractID, dt)
).
Il secondo sistema memorizza i programmi come intervalli con l'elenco dei giorni della settimana che fanno parte del programma. Ogni intervallo è definito dalle date di inizio e fine (incluso) e da un elenco di giorni settimanali inclusi nel programma. In questo formato è possibile definire in modo efficiente schemi settimanali ripetitivi, come lunedì-mercoledì, ma diventa una seccatura quando uno schema viene interrotto, ad esempio nei giorni festivi.
Ecco come apparirà il semplice esempio sopra:
+------------+------------+------------+----------+----------------------+
| ContractID | StartDT | EndDT | DayCount | WeekDays |
+------------+------------+------------+----------+----------------------+
| 1 | 2016-05-02 | 2016-05-13 | 10 | Mon,Tue,Wed,Thu,Fri, |
+------------+------------+------------+----------+----------------------+
[StartDT;EndDT]
gli intervalli che appartengono allo stesso contratto non devono sovrapporsi.
Devo convertire i dati dal primo sistema nel formato utilizzato dal secondo sistema. Al momento lo sto risolvendo sul lato client in C # per il singolo Contratto dato, ma mi piacerebbe farlo in T-SQL sul lato server per l'elaborazione in blocco e l'esportazione / importazione tra server. Molto probabilmente, potrebbe essere fatto usando CLR UDF, ma in questa fase non posso usare SQLCLR.
La sfida qui è quella di rendere l'elenco di intervalli il più breve e rispettoso dell'uomo possibile.
Ad esempio, questo programma:
+-----+------------+------------+---------+--------+
| ID | ContractID | dt | dowChar | dowInt |
+-----+------------+------------+---------+--------+
| 223 | 2 | 2016-05-05 | Thu | 5 |
| 224 | 2 | 2016-05-06 | Fri | 6 |
| 225 | 2 | 2016-05-09 | Mon | 2 |
| 226 | 2 | 2016-05-10 | Tue | 3 |
| 227 | 2 | 2016-05-11 | Wed | 4 |
| 228 | 2 | 2016-05-12 | Thu | 5 |
| 229 | 2 | 2016-05-13 | Fri | 6 |
| 230 | 2 | 2016-05-16 | Mon | 2 |
| 231 | 2 | 2016-05-17 | Tue | 3 |
+-----+------------+------------+---------+--------+
dovrebbe diventare questo:
+------------+------------+------------+----------+----------------------+
| ContractID | StartDT | EndDT | DayCount | WeekDays |
+------------+------------+------------+----------+----------------------+
| 2 | 2016-05-05 | 2016-05-17 | 9 | Mon,Tue,Wed,Thu,Fri, |
+------------+------------+------------+----------+----------------------+
,non questo:
+------------+------------+------------+----------+----------------------+
| ContractID | StartDT | EndDT | DayCount | WeekDays |
+------------+------------+------------+----------+----------------------+
| 2 | 2016-05-05 | 2016-05-06 | 2 | Thu,Fri, |
| 2 | 2016-05-09 | 2016-05-13 | 5 | Mon,Tue,Wed,Thu,Fri, |
| 2 | 2016-05-16 | 2016-05-17 | 2 | Mon,Tue, |
+------------+------------+------------+----------+----------------------+
Ho provato ad applicare un gaps-and-islands
approccio a questo problema. Ho provato a farlo in due passaggi. Nel primo passaggio trovo isole di semplici giorni consecutivi, ovvero la fine dell'isola è un divario nella sequenza di giorni, sia esso fine settimana, festività o qualcos'altro. Per ognuna di queste isole trovate costruisco un elenco separato da virgole di distinti WeekDays
. Nel secondo passaggio ho trovato altre isole osservando il divario nella sequenza dei numeri delle settimane o un cambiamento nel WeekDays
.
Con questo approccio ogni settimana parziale finisce come un intervallo extra come mostrato sopra, perché anche se i numeri delle settimane sono consecutivi, la WeekDays
modifica. Inoltre, ci possono essere intervalli regolari entro una settimana (vedere ContractID=3
nei dati di esempio, che ha dati solo per Mon,Wed,Fri,
) e questo approccio genererebbe intervalli separati per ogni giorno in tale programma. Sul lato positivo, genera un intervallo se la pianificazione non presenta alcun gap (vedere ContractID=7
nei dati di esempio che includono i fine settimana) e in tal caso non importa se la settimana di inizio o fine è parziale.
Si prega di vedere altri esempi nello script qui sotto per avere un'idea migliore di ciò che sto cercando. Puoi vedere che abbastanza spesso i fine settimana sono esclusi, ma anche qualsiasi altro giorno della settimana potrebbe essere escluso. Nell'esempio 3 solo Mon
, Wed
e Fri
sono parte del programma. Inoltre, i fine settimana possono essere inclusi, come nell'esempio 7. La soluzione dovrebbe trattare tutti i giorni della settimana allo stesso modo. Ogni giorno della settimana può essere incluso o escluso dal programma.
Per verificare che l'elenco di intervalli generato descriva correttamente la pianificazione indicata, è possibile utilizzare il seguente pseudo-codice:
- scorrere attraverso tutti gli intervalli
- per ogni intervallo scorrere tutte le date del calendario tra le date di inizio e fine (incluso).
- per ogni data controlla se il suo giorno della settimana è elencato in
WeekDays
. Se sì, questa data è inclusa nel programma.
Speriamo che questo chiarisca in quali casi dovrebbe essere creato un nuovo intervallo. Negli esempi 4 e 5 un lunedì ( 2016-05-09
) viene rimosso dalla metà del programma e tale programma non può essere rappresentato da un singolo intervallo. Nell'esempio 6 c'è un lungo divario nel programma, quindi sono necessari due intervalli.
Gli intervalli rappresentano gli schemi settimanali nella pianificazione e quando uno schema viene interrotto / modificato, è necessario aggiungere il nuovo intervallo. Nell'esempio 11 le prime tre settimane hanno un modello Tue
, quindi questo modello cambia in Thu
. Di conseguenza abbiamo bisogno di due intervalli per descrivere tale programma.
Attualmente sto usando SQL Server 2008, quindi la soluzione dovrebbe funzionare in questa versione. Se una soluzione per SQL Server 2008 può essere semplificata / migliorata utilizzando funzionalità di versioni successive, questo è un vantaggio, per favore mostralo anche.
Ho una Calendar
tabella (elenco di date) e una Numbers
tabella (elenco di numeri interi a partire da 1), quindi è OK usarli, se necessario. È inoltre possibile creare tabelle temporanee e disporre di diverse query che elaborano i dati in più fasi. Tuttavia, il numero di stadi in un algoritmo deve essere corretto, i cursori e i WHILE
loop espliciti non sono corretti.
Script per dati di esempio e risultati previsti
-- @Src is sample data
-- @Dst is expected result
DECLARE @Src TABLE (ID int PRIMARY KEY, ContractID int, dt date, dowChar char(3), dowInt int);
INSERT INTO @Src (ID, ContractID, dt, dowChar, dowInt) VALUES
-- simple two weeks (without weekend)
(110, 1, '2016-05-02', 'Mon', 2),
(111, 1, '2016-05-03', 'Tue', 3),
(112, 1, '2016-05-04', 'Wed', 4),
(113, 1, '2016-05-05', 'Thu', 5),
(114, 1, '2016-05-06', 'Fri', 6),
(115, 1, '2016-05-09', 'Mon', 2),
(116, 1, '2016-05-10', 'Tue', 3),
(117, 1, '2016-05-11', 'Wed', 4),
(118, 1, '2016-05-12', 'Thu', 5),
(119, 1, '2016-05-13', 'Fri', 6),
-- a partial end of the week, the whole week, partial start of the week (without weekends)
(223, 2, '2016-05-05', 'Thu', 5),
(224, 2, '2016-05-06', 'Fri', 6),
(225, 2, '2016-05-09', 'Mon', 2),
(226, 2, '2016-05-10', 'Tue', 3),
(227, 2, '2016-05-11', 'Wed', 4),
(228, 2, '2016-05-12', 'Thu', 5),
(229, 2, '2016-05-13', 'Fri', 6),
(230, 2, '2016-05-16', 'Mon', 2),
(231, 2, '2016-05-17', 'Tue', 3),
-- only Mon, Wed, Fri are included across two weeks plus partial third week
(310, 3, '2016-05-02', 'Mon', 2),
(311, 3, '2016-05-04', 'Wed', 4),
(314, 3, '2016-05-06', 'Fri', 6),
(315, 3, '2016-05-09', 'Mon', 2),
(317, 3, '2016-05-11', 'Wed', 4),
(319, 3, '2016-05-13', 'Fri', 6),
(330, 3, '2016-05-16', 'Mon', 2),
-- a whole week (without weekend), in the second week Mon is not included
(410, 4, '2016-05-02', 'Mon', 2),
(411, 4, '2016-05-03', 'Tue', 3),
(412, 4, '2016-05-04', 'Wed', 4),
(413, 4, '2016-05-05', 'Thu', 5),
(414, 4, '2016-05-06', 'Fri', 6),
(416, 4, '2016-05-10', 'Tue', 3),
(417, 4, '2016-05-11', 'Wed', 4),
(418, 4, '2016-05-12', 'Thu', 5),
(419, 4, '2016-05-13', 'Fri', 6),
-- three weeks, but without Mon in the second week (no weekends)
(510, 5, '2016-05-02', 'Mon', 2),
(511, 5, '2016-05-03', 'Tue', 3),
(512, 5, '2016-05-04', 'Wed', 4),
(513, 5, '2016-05-05', 'Thu', 5),
(514, 5, '2016-05-06', 'Fri', 6),
(516, 5, '2016-05-10', 'Tue', 3),
(517, 5, '2016-05-11', 'Wed', 4),
(518, 5, '2016-05-12', 'Thu', 5),
(519, 5, '2016-05-13', 'Fri', 6),
(520, 5, '2016-05-16', 'Mon', 2),
(521, 5, '2016-05-17', 'Tue', 3),
(522, 5, '2016-05-18', 'Wed', 4),
(523, 5, '2016-05-19', 'Thu', 5),
(524, 5, '2016-05-20', 'Fri', 6),
-- long gap between two intervals
(623, 6, '2016-05-05', 'Thu', 5),
(624, 6, '2016-05-06', 'Fri', 6),
(625, 6, '2016-05-09', 'Mon', 2),
(626, 6, '2016-05-10', 'Tue', 3),
(627, 6, '2016-05-11', 'Wed', 4),
(628, 6, '2016-05-12', 'Thu', 5),
(629, 6, '2016-05-13', 'Fri', 6),
(630, 6, '2016-05-16', 'Mon', 2),
(631, 6, '2016-05-17', 'Tue', 3),
(645, 6, '2016-06-06', 'Mon', 2),
(646, 6, '2016-06-07', 'Tue', 3),
(647, 6, '2016-06-08', 'Wed', 4),
(648, 6, '2016-06-09', 'Thu', 5),
(649, 6, '2016-06-10', 'Fri', 6),
(655, 6, '2016-06-13', 'Mon', 2),
(656, 6, '2016-06-14', 'Tue', 3),
(657, 6, '2016-06-15', 'Wed', 4),
(658, 6, '2016-06-16', 'Thu', 5),
(659, 6, '2016-06-17', 'Fri', 6),
-- two weeks, no gaps between days at all, even weekends are included
(710, 7, '2016-05-02', 'Mon', 2),
(711, 7, '2016-05-03', 'Tue', 3),
(712, 7, '2016-05-04', 'Wed', 4),
(713, 7, '2016-05-05', 'Thu', 5),
(714, 7, '2016-05-06', 'Fri', 6),
(715, 7, '2016-05-07', 'Sat', 7),
(716, 7, '2016-05-08', 'Sun', 1),
(725, 7, '2016-05-09', 'Mon', 2),
(726, 7, '2016-05-10', 'Tue', 3),
(727, 7, '2016-05-11', 'Wed', 4),
(728, 7, '2016-05-12', 'Thu', 5),
(729, 7, '2016-05-13', 'Fri', 6),
-- no gaps between days at all, even weekends are included, with partial weeks
(805, 8, '2016-04-30', 'Sat', 7),
(806, 8, '2016-05-01', 'Sun', 1),
(810, 8, '2016-05-02', 'Mon', 2),
(811, 8, '2016-05-03', 'Tue', 3),
(812, 8, '2016-05-04', 'Wed', 4),
(813, 8, '2016-05-05', 'Thu', 5),
(814, 8, '2016-05-06', 'Fri', 6),
(815, 8, '2016-05-07', 'Sat', 7),
(816, 8, '2016-05-08', 'Sun', 1),
(825, 8, '2016-05-09', 'Mon', 2),
(826, 8, '2016-05-10', 'Tue', 3),
(827, 8, '2016-05-11', 'Wed', 4),
(828, 8, '2016-05-12', 'Thu', 5),
(829, 8, '2016-05-13', 'Fri', 6),
(830, 8, '2016-05-14', 'Sat', 7),
-- only Mon-Wed included, two weeks plus partial third week
(910, 9, '2016-05-02', 'Mon', 2),
(911, 9, '2016-05-03', 'Tue', 3),
(912, 9, '2016-05-04', 'Wed', 4),
(915, 9, '2016-05-09', 'Mon', 2),
(916, 9, '2016-05-10', 'Tue', 3),
(917, 9, '2016-05-11', 'Wed', 4),
(930, 9, '2016-05-16', 'Mon', 2),
(931, 9, '2016-05-17', 'Tue', 3),
-- only Thu-Sun included, three weeks
(1013,10,'2016-05-05', 'Thu', 5),
(1014,10,'2016-05-06', 'Fri', 6),
(1015,10,'2016-05-07', 'Sat', 7),
(1016,10,'2016-05-08', 'Sun', 1),
(1018,10,'2016-05-12', 'Thu', 5),
(1019,10,'2016-05-13', 'Fri', 6),
(1020,10,'2016-05-14', 'Sat', 7),
(1021,10,'2016-05-15', 'Sun', 1),
(1023,10,'2016-05-19', 'Thu', 5),
(1024,10,'2016-05-20', 'Fri', 6),
(1025,10,'2016-05-21', 'Sat', 7),
(1026,10,'2016-05-22', 'Sun', 1),
-- only Tue for first three weeks, then only Thu for the next three weeks
(1111,11,'2016-05-03', 'Tue', 3),
(1116,11,'2016-05-10', 'Tue', 3),
(1131,11,'2016-05-17', 'Tue', 3),
(1123,11,'2016-05-19', 'Thu', 5),
(1124,11,'2016-05-26', 'Thu', 5),
(1125,11,'2016-06-02', 'Thu', 5),
-- one week, then one week gap, then one week
(1210,12,'2016-05-02', 'Mon', 2),
(1211,12,'2016-05-03', 'Tue', 3),
(1212,12,'2016-05-04', 'Wed', 4),
(1213,12,'2016-05-05', 'Thu', 5),
(1214,12,'2016-05-06', 'Fri', 6),
(1215,12,'2016-05-16', 'Mon', 2),
(1216,12,'2016-05-17', 'Tue', 3),
(1217,12,'2016-05-18', 'Wed', 4),
(1218,12,'2016-05-19', 'Thu', 5),
(1219,12,'2016-05-20', 'Fri', 6);
SELECT ID, ContractID, dt, dowChar, dowInt
FROM @Src
ORDER BY ContractID, dt;
DECLARE @Dst TABLE (ContractID int, StartDT date, EndDT date, DayCount int, WeekDays varchar(255));
INSERT INTO @Dst (ContractID, StartDT, EndDT, DayCount, WeekDays) VALUES
(1, '2016-05-02', '2016-05-13', 10, 'Mon,Tue,Wed,Thu,Fri,'),
(2, '2016-05-05', '2016-05-17', 9, 'Mon,Tue,Wed,Thu,Fri,'),
(3, '2016-05-02', '2016-05-16', 7, 'Mon,Wed,Fri,'),
(4, '2016-05-02', '2016-05-06', 5, 'Mon,Tue,Wed,Thu,Fri,'),
(4, '2016-05-10', '2016-05-13', 4, 'Tue,Wed,Thu,Fri,'),
(5, '2016-05-02', '2016-05-06', 5, 'Mon,Tue,Wed,Thu,Fri,'),
(5, '2016-05-10', '2016-05-20', 9, 'Mon,Tue,Wed,Thu,Fri,'),
(6, '2016-05-05', '2016-05-17', 9, 'Mon,Tue,Wed,Thu,Fri,'),
(6, '2016-06-06', '2016-06-17', 10, 'Mon,Tue,Wed,Thu,Fri,'),
(7, '2016-05-02', '2016-05-13', 12, 'Sun,Mon,Tue,Wed,Thu,Fri,Sat,'),
(8, '2016-04-30', '2016-05-14', 15, 'Sun,Mon,Tue,Wed,Thu,Fri,Sat,'),
(9, '2016-05-02', '2016-05-17', 8, 'Mon,Tue,Wed,'),
(10,'2016-05-05', '2016-05-22', 12, 'Sun,Thu,Fri,Sat,'),
(11,'2016-05-03', '2016-05-17', 3, 'Tue,'),
(11,'2016-05-19', '2016-06-02', 3, 'Thu,'),
(12,'2016-05-02', '2016-05-06', 5, 'Mon,Tue,Wed,Thu,Fri,'),
(12,'2016-05-16', '2016-05-20', 5, 'Mon,Tue,Wed,Thu,Fri,');
SELECT ContractID, StartDT, EndDT, DayCount, WeekDays
FROM @Dst
ORDER BY ContractID, StartDT;
Confronto di risposte
La tabella reale @Src
ha 403,555
righe con 15,857
distinti ContractIDs
. Tutte le risposte producono risultati corretti (almeno per i miei dati) e tutte sono ragionevolmente veloci, ma differiscono nell'ottimalità. Meno intervalli vengono generati, meglio è. Ho incluso i tempi di esecuzione solo per curiosità. L'obiettivo principale è il risultato corretto e ottimale, non la velocità (a meno che non impieghi troppo tempo - ho interrotto la query non ricorsiva di Ziggy Crueltyfree Zeitgeister dopo 10 minuti).
+--------------------------------------------------------+-----------+---------+
| Answer | Intervals | Seconds |
+--------------------------------------------------------+-----------+---------+
| Ziggy Crueltyfree Zeitgeister | 25751 | 7.88 |
| While loop | | |
| | | |
| Ziggy Crueltyfree Zeitgeister | 25751 | 8.27 |
| Recursive | | |
| | | |
| Michael Green | 25751 | 22.63 |
| Recursive | | |
| | | |
| Geoff Patterson | 26670 | 4.79 |
| Weekly gaps-and-islands with merging of partial weeks | | |
| | | |
| Vladimir Baranov | 34560 | 4.03 |
| Daily, then weekly gaps-and-islands | | |
| | | |
| Mikael Eriksson | 35840 | 0.65 |
| Weekly gaps-and-islands | | |
+--------------------------------------------------------+-----------+---------+
| Vladimir Baranov | 25751 | 121.51 |
| Cursor | | |
+--------------------------------------------------------+-----------+---------+
@Dst
). Le prime due settimane del programma hanno solo Tue
, quindi non puoi avere WeekDays=Tue,Thu,
per queste settimane. Le ultime due settimane del programma hanno solo Thu
, quindi non puoi più averlo WeekDays=Tue,Thu,
per queste settimane. La soluzione non ottimale sarebbe di tre file: solo Tue
per le prime due settimane, poi Tue,Thu,
per la terza settimana che ha entrambe Tue
e Thu
, quindi solo Thu
per le ultime due settimane.
ContractID
cambia, se intervallo va oltre 7 giorni e il nuovo giorno della settimana non è mai stato visto prima, se c'è un gap nella lista dei giorni programmati.
(11,'2016-05-03', '2016-05-17', 3, 'Tue,'), (11,'2016-05-19', '2016-06-02', 3, 'Thu,');
Nel @Dst non dovrebbe essere una riga conTue, Thu,
?