Infrastruktura Digio

Modelet e AI dhe GPU

Drejtoni agjentët në modelet kufitare të menaxhuara sot—ose merrni me qira kapacitetin e GPU-së, vendosni peshat tuaja dhe drejtoni detyrat e Digio në pikat fundore private në të njëjtën hapësirë ​​pune.

Claude, GPT, Binjakët Zgjedhja e modelit për agjent GPU me qira dhe BYOM
Modele të menaxhuara

Modelet në dispozicion sot në Digio

Caktoni një model të paracaktuar për agjent ose anuloni për detyrë. Përdorimi matet në Digio Tokens nga balanca e planit tuaj - i njëjti portofol pavarësisht nëse agjenti telefonon Sonnet, GPT-4o ose Gemini Flash.

Antropik Klodi

  • Claude Opus 4.7 Arsyetimi kryesor, konteksti i gjatë, arkitektura dhe puna strategjike.
  • Claude Opus 4.6 Opus i gjeneratës së mëparshme për analiza të qëndrueshme dhe me cilësi të lartë.
  • Claude Sonnet 4.6 Shoferi ditor-kodimi, shkrimi dhe unazat e agjentëve me shumë hapa.
  • Claude Sonnet 4.5 / 4 Nivelet e shpejta të Sonetit me memorie të menjëhershme në ngarkesat e mbështetura të punës.
  • Claude Haiku 4.5 Hartime me vonesë të ulët, klasifikim dhe nëndetyra me volum të lartë.

Përkthe fjalë për fjalë: OpenAI

  • GPT-5.5 / GPT-5.4 / GPT-5.2 Familja më e fundit GPT-5 për ngarkesat e përgjithshme dhe agjentët e punës.
  • GPT-4.1 & GPT-4o Bisedë e besueshme multimodale dhe përdorim i mjeteve për agjentët e prodhimit.
  • GPT-4o mini Rrugë me kosto efektive për përmbledhjet dhe hapat e lehtë.
  • o3 / o3-pro / o3-mini / o4-mini Modele të fokusuara në arsyetim për matematikën, planifikimin dhe verifikimin.
  • GPT-5.3 Codex & Codex mini Gjenerimi i kodit, rifaktorët dhe aftësitë e agjentëve të vetëdijshëm për repo.

Google Binjakët

  • Gemini 2.5 Pro Hulumtim me kontekst të gjatë dhe nxjerrje e strukturuar.
  • Gemini 2.5 Flash Agjenti me performancë të lartë hapa me tarifa konkuruese token.
  • Gemini 2.0 Flash Kalime jashtëzakonisht të shpejta për analizim, etiketim dhe punë grupore.

API të hapura dhe të specializuara

  • DeepSeek Chat & Reasoner Vlera e fortë për bisedat dhe detyrat e stilit të mendimit.
  • Mistral Large Opsioni i organizuar në Evropë për ekipet e agjentëve shumëgjuhësh.
  • Llama 3.3 70B Modeli i klasës me peshë të hapur nëpërmjet API-çiftohet mirë me GPU-në private.
  • Grok 3 Model i orientuar në kohë reale për agjentët e lajmeve dhe monitorimit social.
  • Sonar Pro Përgjigje të bazuara në kërkim për agjentët kërkimorë.
  • Command R+ Flukset e punës për bisedën dhe rikthimin e ndërmarrjeve miqësore për RAG.

Model list and token economics evolve with provider releases. Your workspace shows live options when you assign a model to an agent; Digio Tokens debit from the same balance as in pricing.

Përdorimi

Si agjentët zgjedhin një model

Koordinatori mund të rekomandojë Sonnet vs Opus vs një model më të lirë flash bazuar në llojin e detyrës. Përdoruesit e fuqisë vendosin parazgjedhje për rolin e agjentit—kërkim mbi Sonet, rishikim përfundimtar në Opus, etiketim në masë në Haiku ose Gemini Flash.

  • Per agent — default model in agent settings; override in To do or chat when needed.

  • Metered fairly — input, output, and cached tokens map to Digio Token charges (see usage in your wallet).

  • Skills stay the same — tools and integrations work across models; only latency and cost profile change.

  • Plan limits — more agents and monthly Digio Tokens on higher tiers; top up anytime on the pricing page.

GPU me qira

Merr me qira GPU dhe drejto modelet e tua

Keni nevojë për një rregullim të imët, një pikë kontrolli me boshllëk ajri ose një çmim konkluzioni të parashikueshëm? Shtoni kapacitetin e dedikuar të GPU-së në hapësirën tuaj të punës Digio, instaloni grupin e shërbimit që preferoni dhe vendosni agjentët në pikën tuaj përfundimtare private.

Raste të dedikuara

Nyjet GPU për orë ose mujore (klasa A100, H100, L40S) të bashkangjitura me qiramarrësin tuaj—të izoluara nga klientët e tjerë.

Peshat tuaja

Ngarko siguruesit, GGUF ose tërhiqe nga regjistri; ekzekutoni Llama, Mistral, Qwen dhe meloditë e personalizuara.

Shërbim standard

vLLM, TGI, Ollama ose imazhet e kontejnerit që mbani - agjentët e Digio thërrasin një URL bazë të pajtueshme me OpenAI.

I njëjti orkestrim

Për të bërë, biseda në ekip, aftësitë dhe bashkëpunimi janë të pandryshuara - vetëm fundi i përfundimit është i juaji.

Drejtimi hibrid

Dërgoni hapa të ndjeshëm te GPU-ja private dhe përdorni Claude ose GPT për kërkime publike në një rrjedhë pune.

Kontrollet e ndërmarrjes

VPC peering, dalje statike, regjistrat e auditimit dhe listat e modelit të lejeve për ekipet e rregulluara.

Sillni modelin tuaj

Instaloni dhe lidhni një model të personalizuar

Konfigurimi tipik nga zero tek agjentët që thërrasin pikën tuaj përfundimtare:

  1. Rezervo GPU

    Zgjidhni VRAM, rajonin dhe kohën e funksionimit (burst vs gjithmonë ndezur). Magazinimi për pesha dërgohet me shembullin ose monton kovën tuaj.

  2. Vendosni pirgun

    Filloni një imazh të shërbimit ose SSH, instaloni drejtuesit CUDA dhe ngarkoni pikat e kontrollit. Kontrollet shëndetësore konfirmojnë se modeli është gati.

  3. Regjistro pikën përfundimtare

    Shto URL-në bazë, çelësin API dhe ID-në e modelit në cilësimet e hapësirës së punës. Digio vërteton vonesën dhe formatin e shenjave përpara se të transmetohet drejtpërdrejt.

  4. Cakto agjentëve

    Zgjidhni modelin tuaj privat si të paracaktuar për agjentët e zgjedhur; Modelet e menaxhuara Claude/GPT mbeten të disponueshme krah për krah.

Qiraja e GPU-së faturohet veçmas nga abonimet e planit Digio. Na kontaktoni për planifikimin e kapaciteteve, SLA-të dhe migrimin nga një grup ekzistues konkluzionesh.

Etiketa e ndërfaqes së internetit të B2B SaaS. Përkthejeni në katrorin natyror: FAQ

Pyetje për modelet dhe GPU

Zgjedhja e API-ve të menaxhuara kundrejt konkluzionit të vetë-pritur në Digio.

A paguaj dy herë—plan plus API?

Abonimi juaj Digio mbulon infrastrukturën, agjentët dhe Digio Tokens të përfshirë. Përdorimi i modelit të menaxhuar e debiton atë balancën e tokenit nga argumentet aktuale hyrëse/dalëse. Marrja me qira e GPU-së është një shtesë për makinat që kontrolloni.

A mund të përdorin agjentë të ndryshëm modele të ndryshme?

Po - çdo agjent mund të ketë parazgjedhjen e tij. Detyrat dhe bisedat mund të anashkalohen për një ekzekutim të vetëm pa ndryshuar parazgjedhjen globale.

Cili është ndryshimi midis Sonetit dhe Opus?

Opus është akorduar për arsyetim më të vështirë dhe plane më koherente; Soneti është më i shpejtë dhe më i lirë për lakimet e përditshme të agjentëve. Haiku dhe modelet e klasës flash janë më të mirat për nën-detyrat e vëllimit.

A mund të ekzekutoj vetëm modelin tim dhe të bllokoj API-të e cloud?

Hapësirat e punës të ndërmarrjeve mund të kufizojnë ofruesit e modeleve dalëse dhe të drejtojnë të gjithë trafikun e agjentëve në pikën e fundit të GPU-së. Modaliteti hibrid është i paracaktuar për shumicën e ekipeve.

Cilat madhësi GPU janë të disponueshme?

Ofertat varen nga rajoni dhe kërkesa - zakonisht nivelet VRAM 24-80 GB për modelet e klasës 7B-70B dhe nyjet me shumë GPU për grupet më të mëdha. Ne ndihmojmë në madhësinë e VRAM nga numërimi dhe kuantizimi i parametrave tuaj.

Përdorimi privat i GPU-së a konsumon ende Digio Tokens?

Orkestrimi (agjentët, detyrat, ruajtja) qëndron në planin tuaj. Konkluzioni në GPU-në tuaj faturohet si kohë GPU; ju mund të matni opsionalisht përdorimin në formë token për rimbursim të brendshëm.

Zgjidhni modelet e menaxhuara ose sillni GPU-në tuaj

Filloni në Claude dhe GPT sot, më pas shtoni GPU të dedikuar kur të jeni gati për të pritur peshat e personalizuara—të njëjtët agjentë, të njëjtat detyra, konkluzionet tuaja.