OpenOcean
Alle cases

ScalarDelta

scalardelta.com

Egen AI-model trænet på et selvbygget korpus: fra filing til scoret forward-fordeling

Udfordringen

Alle har priser, og alle har regnskabstal. Det der ikke fandtes, var en struktureret, point-in-time optegnelse af HVORFOR et lille selskabs udsigter ændrede sig — maskinlæsbar, sammenlignelig på tværs af tusindvis af navne og år, og bygget til at kunne testes mod faktiske forward-afkast. Et sentiment-tal på en nyhedsoverskrift duer ikke: det skal kunne stå som en typed påstand om forretningen, med retning, materialitet og horisont. Dertil kom de fælder enhver der selv har bygget signaler kender: pooled embeddings der udvisker klyngerne, survivorship i valideringsuniverset, og et backtest der bliver tunet indtil det er sandt.

Vores tilgang

Vi byggede stakken i Python fra ingest til score. Filings, 8-K'er og selskabsnyheder lander i eget store hver session og læses til typed mekanisme-evidens, hvor sprogmodellen har én snæver opgave: at omsætte et dokument til struktur. Evidensen embeddes og matches per event mod mekanisme-centroider på dokumentets egen dato — aldrig pooled per selskab, netop fordi en middelværdi pr. selskab kollapser klyngerne. Klyngedannelsen, centroid-geometrien og scorerne ovenpå er trænet på korpusset og kører på NVIDIA-GPU'er med CUDA, så embedding- og træningskørsler kan gentages i stedet for at være et engangsforsøg. Hvert navn bærer desuden en daglig state-vektor (konveksitet, kompression, position i 52-ugers-strukturen, kohorte-relativ momentum), og state × mekanisme × kalender fusioneres til sleeve-scores med eksplicit entry-status. Validering er walk-forward på et frosset univers der bevidst indeholder de døde selskaber, og hvert resultat bærer effektiv stikprøvestørrelse og en nedre konfidensgrænse. Fordi det er vores eget produkt, betaler vi selv prisen for hver forkert antagelse — det er en anden slags kvalitetskontrol end en leverance der bliver godkendt og lukket.

Resultater

695 papirer, 95 delistede bevaret

Valideringsunivers

~740 navne

Dagligt AI-læst

Walk-forward, aldrig in-sample

Validering

Klar til lignende resultater?

Lad os tage en uforpligtende snak om jeres muligheder.

Kontakt os