DeepSeek V4: 1T-parametermodellen, der ønsker at dominere den lange kontekst

  • DeepSeek V4 leveres med en Mixture-of-Experts-arkitektur på op til 1,6T parametre og tæt på 1T i åbne modeller, hvilket kun aktiverer titusindvis af milliarder pr. token for at øge effektiviteten.
  • V4-familien tilbyder et kontekstvindue på op til 1 million tokens som den nye standard, hvilket giver dig mulighed for at arbejde med massive kodelagre og dokumentation i én arbejdsgang.
  • Pro- og Flash-varianterne kombinerer høj ydeevne, multimodalitet og meget lave inferensomkostninger sammenlignet med lukkede modeller som GPT eller Claude.
  • Åbningen af ​​vægte og kompatibilitet med populære API'er bringer frontlinje-AI tættere på europæiske startups og virksomheder, med en særlig indvirkning på Spanien og det spansktalende økosystem.

DeepSeek V4-model lang kontekst

DeepSeeks nye generation af modeller er blevet fokus for den teknologiske debat med et meget klart forslag: kontekst af op til en million tokens og en arkitektur af mere end en billion parametre Det kinesiske firma er designet til at være effektivt og frem for alt meget billigere end lukkede kredsløbsalternativer i USA, og har satset all-in på V4, en familie der kombinerer åbne vægte, et stort kontekstvindue og en aggressiv prisstrategi.

Dette skridt kommer på et tidspunkt, hvor Europa og Spanien gransker omkostningerne og den teknologiske suverænitet ved AI. DeepSeek V4 præsenterer sig selv som en attraktiv mulighed for europæiske startups, SMV'er og store virksomheder der har brug for grænseoverskridende funktioner, men som ikke kan – eller ikke ønsker – at stole udelukkende på dyre, proprietære API'er eller eksklusiv hardware som de mest eftertragtede NVIDIA GPU'er.

En V4-familie centreret omkring 1T parametre og en kontekst af 1M tokens

DeepSeek V4-arkitektur

DeepSeek har annonceret ankomsten af ​​DeepSeek-V4 Preview som en familie af åbne modeller, der drejer sig om to ideer: et kontekstvindue med op til 1 million tokens og gigantiske arkitekturer baseret på Mixture-of-Experts (MoE)Inden for denne familie skiller to hovedvarianter sig ud: DeepSeek-V4-Pro og DeepSeek-V4-Flash, begge med den 1M-kontekst som kendetegn.

I den mest ambitiøse ende opererer V4-Pro i tallene op til 1,6 billioner parametre i alt (1,6T), selvom den kun aktiverer mellem 32 og 49 milliarder parametre i hvert inferenstrin takket være MoE-ordningen, hvilket er afgørende for at opretholde effektiviteten. Parallelt har virksomheden introduceret lettere varianter, såsom V4-Flash og V4-Lite, med omkring 284-285 milliarder samlede parametre og omkring 13 milliarder aktive parametre, designet til implementeringer, hvor hastighed og omkostninger er prioriteter.

Det samlede antal parametre placerer V4-familien i toppen af ​​markedet, men den vigtige detalje er, at Kun en brøkdel af disse eksperter er token-aktiverede.Dette gør det muligt for den at opføre sig som en gigantisk model med hensyn til kapacitet, men med et strømforbrug, der er tættere på meget mindre modellers. Det er en tilgang, der passer ind i DeepSeeks fortælling: at konkurrere med store modeller med lukket kildekode uden at øge brugsomkostningerne voldsomt.

Virksomheden har også udgivet foreløbige varianter som V4-Lite, der fungerer som teknisk validering, og har justeret implementeringsplanen. Selvom V4 er stadig i en begrænset testfase I nogle sammenhænge kan V4 Preview-familien allerede bruges i den officielle chatbot og gennem virksomhedens opdaterede API, med 1M-konteksten som standardværdi i dens tjenester.

Hybridarkitektur og en blanding af eksperter for at gøre den langsigtede kontekst levedygtig

Nøglen til DeepSeeks evne til at tilbyde et kontekstvindue på en million tokens uden at inferensomkostningerne stiger voldsomt ligger i dens arkitektur. Producenten forklarer, at V4 introducerer en kombination af hybridpleje, Mixture-of-Experts og kompressionsteknikker designet til at arbejde med meget lange sekvenser, hvilket reducerer både FLOP'er pr. token og den nødvendige hukommelse.

Blandt de tekniske komponenter, som virksomheden nævner, skiller følgende sig ud: MLA (Multi-Head Latent Attention), DSA eller DeepSeek Sparse Attention og betingede hukommelsesmekanismer såsom EngramSammen har disse komponenter til formål at reducere byrden ved opmærksomhedsberegning, især når modellen skal håndtere hundredtusindvis eller en million tokens i en enkelt gennemgang.

Ifølge data delt af virksomheden selv, i scenarier med 1 million tokens DeepSeek-V4-Pro kræver muligvis omkring 27% af FLOP'erne pr. token og kun 10% af KV-cachen sammenlignet med tidligere versioner som DeepSeek-V3.2.Lettere varianter, såsom V4-Flash, reducerer disse tal yderligere og positionerer sig som hurtige inferensløsninger til applikationer, hvor latenstid er kritisk.

Disse typer forbedringer er ikke kun teoretiske: virksomheden hævder, at kombinationen af ​​MoE, spredt opmærksomhed og kontekstforståelse tillader opererer med ultralang kontekst i mindre ekstrem hardware allerede en pris pr. million tokens, der er betydeligt lavere end for mange lukkede modeller med vinduer på 128 eller 200 tokens.

Ydeevne i ræsonnement, programmering og agentopgaver

DeepSeek ønsker ikke kun at skille sig ud på grund af sin størrelse og kontekst. I sine interne sammenligninger insisterer virksomheden på, at V4-Pro og dens varianter er specielt optimeret til kompleks ræsonnement, programmering og agenterDisse tre områder tegner sig i øjeblikket for en betydelig del af erhvervslivets efterspørgsel. Benchmarks som SWE-bench, der er designet til at måle kapaciteten hos Forståelse og ændring af kodelagreDer tales om tal over 80% nøjagtighed, hvilket stemmer overens med førende lukkede modeller.

Inden for mere generel ræsonnement – ​​herunder matematik, STEM-discipliner og tankekædeproblemer – placerer virksomheden V4-Pro som en af ​​de stærkeste åbne modellerog argumenterer for, at det nærmer sig niveauet af forslag om lukkede grænser. Med hensyn til global bevidsthed placerer interne data det i spidsen for det åbne økosystem og kun bag et par meget specifikke proprietære modeller, såsom visse avancerede varianter af Gemini.

Ud over tallene er der fokus på agentopgaver Det peger på en anvendelse, der går langt ud over almindelig chat. DeepSeek hævder, at V4 driver allerede sin egen infrastruktur af kodeagenter og systemer, der kæder flere trin sammenDe tilgår værktøjer og arbejder på omfattende arkiver eller dokumentdatabaser. Denne tilgang stemmer overens med den nuværende branchtrend, hvor mange virksomheder ikke længere blot leder efter en chatbot, men efter assistenter, der er i stand til at fungere som "digitale kolleger" inden for komplekse arbejdsgange.

Disse sammenligninger bør tages med et gran salt: som med næsten alle nyere AI-udgivelser, Meget af dataene kommer fra virksomheden selv og fra tests i kontrollerede miljøer.Alligevel skaber kombinationen af ​​lang kontekst, effektiv arkitektur og konkurrencedygtig ydeevne opmærksomhed blandt europæiske udviklere, der sammenligner omkostninger og muligheder med muligheder som GPT, Claude, Llama eller Mistral.

Åbne modeller, publicerede vægte og kompatibilitet med populære API'er

En af nøglefaktorerne, der har givet DeepSeek dens berømmelse, er dens engagement i det åbne økosystem. Med V4 forstærker virksomheden denne tilgang: har udgivet den tekniske rapport og frigivet åbne vægte for familien på platforme som Hugging Facehvilket giver forskere, virksomheder og offentlige forvaltninger mulighed for at downloade modellerne og køre dem på deres egen infrastruktur.

Denne åbne tilgang har, i modsætning til de fuldstændig lukkede forslag fra mange amerikanske laboratorier, klare konsekvenser for Spanien og Den Europæiske Union. Muligheden for at implementere disse modeller i datacentre i EUunder rammer som GDPR og EU's fremtidige AI-forordningDet giver en måde at opretholde større kontrol over data uden at ofre førsteklasses funktioner.

Med hensyn til praktisk integration har DeepSeek valgt at reducere friktion: API'en opretholder den samme base_url og er kompatibel med OpenAI's ChatCompletions-skemaer og med Antropiske grænsefladerFor mange udviklingsteams betyder det, at migrering af tests eller dele af trafikken til V4 i bund og grund er begrænset til at ændre modelidentifikatoren til deepseek-v4-pro eller deepseek-v4-flash og justere et par parametre.

Samtidig har virksomheden sat en tidsplan for pensionering af ældre modeller, såsom deepseek-chat og deepseek-reasoner. De vil blive udgået og omdirigeret til V4-Flash indtil deres fuldstændige tilbagetrækning, hvilket tvinger dem, der brugte dem, til at begynde at forberede sig på migreringen. Det er en klar måde at koncentrere tilbuddet om den nye generation og undgå at fragmentere brugerbasen i for mange ældre varianter.

Indesluttede inferensomkostninger og fokus på økonomisk effektivitet

DeepSeeks fortælling har siden starten drejet sig om effektivitet. Med V4 forstærkes denne diskurs af en kombination af MoE-arkitektur, distribueret opmærksomhed og hardwareoptimering, der sigter mod at... sænke omkostningerne pr. million tokens til niveauer, der ligger langt under de mest kendte premium API'erNogle eksterne analyser nævner tal omkring $0,30 pr. million entry-tokens for visse konfigurationer, hvilket er en brøkdel af, hvad high-end lukkede modeller opkræver.

I en europæisk kontekst, hvor infrastruktur- og energiomkostninger er relevante, passer dette fokus på effektivitet godt til behovene hos startups og SMV'er. Behandling af omfattende juridiske dokumenter, lange lægejournaler eller hele softwarelagre Det ophører med at være en luksus forbeholdt virksomheder med næsten ubegrænsede budgetter og bliver en del af overkommelige scenarier for nye projekter.

Nogle udbydere af AI-infrastruktur tilbyder allerede tidlig adgang til DeepSeek V4-baserede noder som en del af deres kataloger, hvilket gør det nemmere for europæiske virksomheder. de kan evaluere reel ydeevne og omkostninger uden at skulle bygge deres egen infrastruktur fra bunden.For mange organisationer er denne testfase det indledende trin, før man beslutter, om man skal fortsætte med en outsourcet model eller vælge lokale implementeringer.

I mellemtiden har virksomhedens delvise tavshed vedrørende de præcise træningsomkostninger og den specifikke hardware, der anvendes, rejst tvivl i nogle sektorer. Siden 2025 har der floreret mistanke om den reelle mængde ressourcer, der kræves for at træne dens modeller, herunder estimater, der peger på titusindvis af high-end GPU'er. DeepSeek insisterer på, at de har opnået en ny fase af "rentabel langsigtet kontekst"Men den har endnu ikke helt afklaret de ukendte forhold om det materielle omfang af sine operationer.

Indvirkning på startups og virksomheder i Spanien og Europa

For det europæiske iværksætterøkosystem, og især for teknologistartups i Spanien, åbner fremkomsten af ​​modeller som DeepSeek V4 muligheder, der indtil for nylig var vanskelige at overveje. Få adgang til en model med over en billion parametre inden for konteksten af ​​1 million tokens og åbne vægte Det giver dig mulighed for at udforske avancerede produkter uden udelukkende at være afhængig af leverandører i Silicon Valley.

I regulerede sektorer – finans, sundhed, jura, offentlig administration – er muligheden for Kør modellen i datacentre i EU eller endda i dine egne faciliteter Dette er især relevant. Overholdelse af GDPR og nationale databeskyttelsesregler bliver mere håndterbar, når information ikke behøver at forlade europæiske jurisdiktioner for at blive behandlet af en AI-model.

Spanske startups, der arbejder med store mængder dokumenter, såsom juridisk teknologi, sundhedsteknologi eller udviklerværktøjer, kan udnytte 1M tokens-konteksten til at analyse af komplette filer, meget lange sygehistorier eller monolitiske kodelagre uden at skulle opdele dem i flere dele og designe komplicerede gendannelsessystemer. Dette reducerer den tekniske kompleksitet og i mange tilfælde også latenstid.

Samtidig er det vigtigt at huske på risiciene: økosystemet af værktøjer omkring DeepSeek er yngre end andre åbne modeller som Llama, og Dokumentationen og fællesskabets støtte er stadig under udvikling.Desuden introducerer det faktum, at det er en kinesisk virksomhed, en geopolitisk komponent, som nogle europæiske organisationer ser med forsigtighed, især i projekter knyttet til administrationer eller kritisk infrastruktur.

Et træk, der lægger pres på dyre, lukkede modeller

Ud over sine specifikke specifikationer fortolkes DeepSeek V4 inden for sektoren som et yderligere skridt i konkurrencepresset på de dyreste lukkede modeller på markedetVed at etablere 1M-token-konteksten som standard på tværs af sine officielle tjenester og ledsage den med åbne vægte, sender det kinesiske firma et klart budskab: den ultralange kontekst behøver ikke længere at være en eksklusiv funktion i et par dyre proprietære modeller.

For store vestlige laboratorier udgør dette en udfordring. OpenAI, Anthropic og Google har historisk set brugt en kombination af højere kvalitet, bredere kontekst og proprietært økosystem som et værditilbud. Fremkomsten af ​​et åbent alternativ med en endnu bedre kontekst i nogle tilfælde og meget lave omkostninger tvinger en gentænkning af produkt- og prisstrategier, især i segmenter, hvor brugervirksomhedernes margin er snæver.

I den spansktalende verden, hvor mange startups opererer med langt mere beskedne budgetter end deres modparter i USA, arbejder konkurrencepresset til deres fordel. Jo flere kraftfulde og åbne modeller der er tilgængelige, desto større mulighed vil de tekniske teams have for at vælge baseret på pris, overholdelse af lovgivningen og anvendelsesscenarier.og ikke kun fra brandet bag API'en.

Samtidig ved DeepSeek, at deres satsning ikke er uden udfordringer: de fleste benchmarks og sammenligninger kommer fra deres egen dokumentation eller fra tests i forhåndsvisningsfaser, og markedet venter stadig på at se, hvordan V4-modellerne klarer sig, når de implementeres massivt i krævende produktionsmiljøer, herunder europæiske.

Samlet set konsoliderer ankomsten af ​​DeepSeek V4 en tendens, der har været under udvikling i et stykke tid: Avancerede AI-modeller er ikke længere udelukkende forbeholdt nogle få virksomheder med lukkede systemer og astronomiske budgetter.Med en kombination af over 1 parametre, en kontekst af 1 million tokens, åbne vægte og en diskurs med fokus på effektivitet introducerer det kinesiske firma et alternativ, som virksomheder og udviklere i Spanien og Europa næppe vil kunne ignorere i deres kommende planer for at implementere og forny AI-infrastruktur.

Konference om kunstig intelligens
relateret artikel:
Konferencer om kunstig intelligens bringer kunstig intelligens tættere på SMV'er, turisme og universitetssektoren

Tilføj som foretrukken kilde