Vores boligvurderingsmodel bruger offentlige registerdata, historiske handler og geodata målt fra DAR-adressepunktet. Den består af et neuralt netværk og en ridge-regressionsmodel for hver ejendomstype.
Det neurale netværk bruger Multi-Head Gated Attention til at vægte referencehandler. Det skaber en embedding: en komprimeret matematisk beskrivelse af boligen og dens sammenligningsgrundlag. I den aktuelle standardkonfiguration har embeddingen 50 dimensioner. En særskilt ridge regression for hver ejendomstype omsætter derefter signalet til en faktor, der justerer en lokal markedspris.
Arkitekturen er udviklet med afsæt i Sellam m.fl.s fagfællebedømte studie Boosting house price estimations with Multi-Head Gated Attention. [4] Studiet viser, at embeddings fra attention-modellen kan gøre en enkel lineær regression mere præcis end mere komplekse ensemblemodeller på de undersøgte datasæt. Vores implementering er tilpasset danske registerdata og udvider metoden med en særskilt kanal til grund- og nedrivningshandler samt ejendomstypespecifikke ridge-regressioner. Den er derfor ikke en identisk reproduktion af forskningsmodellen.
Før træning renser vi handlerne:
Den lokale markedsbaseline bruger et rullende tremåneders gennemsnit pr. kommune og ejendomstype, korrigeret for forsinkelse i registrering. [3]
I produktionsserien sættes kommunestatistikkens publiceringsgrænse til den første dag i måneden før modeldatoen. Kun tremånedersvinduer, der slutter senest på grænsen, kan indgå i markedsbaselinen. Historiske modelmål får den seneste afsluttede statistik for samme kommune og ejendomstype på det relevante tidspunkt; fremtidige vinduer bruges ikke. Ved prisfremskrivning af referencehandler bruges i stedet kommunens vindue for samme ejendomstype, som indeholder referencehandlens købsaftaledato.
Den aktuelle standardkonfiguration søger efter referencehandler i de foregående 1.460 dage. Perioden er en modelparameter og kan ændres mellem modelversioner og kontrollerede testkørsler.
Modeltræningen filtrerer ekstreme handler lokalt. Når der er nok data, sammenlignes hver handel med de 40 geografisk nærmeste handler af samme ejendomstype. Et robust interval beregnes ud fra medianen og medianen af de absolutte afvigelser. Det er en anden metode end outlier-intervallet [-2;3], som bruges i kommunestatistikken. [2]
Det neurale netværk bruger i den aktuelle implementering 13 geografiske og 45 strukturelle numeriske input. Nogle strukturelle input er kun aktive for de ejendomstyper, hvor de giver mening:
Ejendomstype og kommune indgår som kategoriske embeddings. Inden træningen skaleres de numeriske input inden for hver ejendomstype med median og interkvartilafstand. Handelsprisen log-transformeres, og netværket trænes med Huber-tab samt en blød straf for estimater langt fra referenceprisernes fordeling. Det reducerer følsomheden over for ekstreme observationer, men fjerner ikke usikkerhed fra manglende eller forkerte registerdata.
Modellen bruger tre separate kanaler. I den aktuelle standardkonfiguration er de:
Hver kanal behandles af fire parallelle attention-heads i standardkonfigurationen. De kan lære forskellige vægtninger af referencehandlerne, mens en gate-mekanisme normaliserer bidraget fra de fire heads, før signalerne samles.
Antallene er modelparametre, ikke en garanti for alle historiske kørsler eller fremtidige modelversioner. Hvis der mangler tilstrækkelige referencehandler eller nødvendige data, returnerer modellen ikke nødvendigvis et estimat.
Modellen arbejder i fire trin:
I den aktuelle standardkonfiguration viser brugerfladen op til 10 geografiske, 10 strukturelle og 5 grund- eller nedrivningshandler, altså op til 25 i alt. De er kun et udsnit af modellens sammenligningsgrundlag.
Modellen dækker:
Andelsboliger, almene boliger og hele bygninger behandles ikke med samme model.
Ved produktionsrettet træning reserveres de nyeste 10 % af handlerne inden for hver ejendomstype som et tidsmæssigt holdout. Holdout-handlerne bruges ikke som referencehandler i den validering.
Den interne benchmarkkørsel bruger i stedet tre separate folds. Hvert target holdes ude af sit eget referencegrundlag, men testen er ikke helt blind: priser fra en testfold kan påvirke afledte input til andre observationer, det lokale outlierfilter og kommunegrundlaget. Benchmarkresultaterne er derfor et internt signal og ikke en uafhængig validering.
Præcision måles i DREAM/BVC-format med blandt andet PM5, PM10, PM20, absolut fejl, RMSE og MAPE. Vi beregner desuden R² på de endelige holdt-ude estimater og observerede handelspriser i kroner. National R² beregnes samlet på observationerne og ikke som et gennemsnit af regionale R²-værdier. [1]
[1]: https://bvc.dk/faglige-udgivelser/prisen-paa-ejerboliger-1992-2021/ Prisen på ejerboliger 1992-2021
[2]: https://finansdanmark.dk/tal-og-data/boligstatistik/boligmarkedsstatistikken/datagrundlaget-for-statistikken/ Datagrundlaget for statistikken
[3]: https://bvc.dk/faglige-udgivelser/forsinkelser-i-registreringen-af-ejendomshandler-og-betydningen-for-prisstatistik-for-ejerboliger/ Forsinkelser i registreringen af ejendomshandler og betydningen for prisstatistik for ejerboliger
[4]: https://doi.org/10.1016/j.eswa.2024.125276 Sellam m.fl.: Boosting house price estimations with Multi-Head Gated Attention, Expert Systems with Applications 259 (2025)