Studiu · 29 iulie 2026 · voost vision

Memoria din cloud vs. memoria de pe masa ta

Am mutat toată memoria Honcho (560 de sesiuni, 84.159 de concluzii) pe Mac Mini și am pus cele două instanțe față în față: aceleași 45 de întrebări, aceleași 20 de căutări, aceleași măsurători — cap la cap.

☁ Cloud (Plastic Labs)
răspunsuri corecte din 39 factuale
  • Capcane de halucinație5/5 curate
  • Search relevant20/20
  • Erori pe durata testului0
⌂ Local (Mac Mini)
răspunsuri corecte din 39 factuale
  • Capcane de halucinație4/5 1 inventat
  • Search relevant13/20 + 4 erori quota
  • Erori pe durata testului5 (toate 429, reparabile)

Scor calculat live din datele brute ale benchmark-ului, încorporate în pagină. Apasă pe orice întrebare mai jos ca să vezi ambele răspunsuri reale.

De ce a existat studiul

Pe 29 iulie, contul Honcho cloud era pe minus (−$0.16): memoria nu mai răspundea la întrebări, iar 1.847 de fragmente de conversație așteptau neprocesate — adică memoria era și moartă, și rămasă în urmă. Întrebarea: dacă tot plătim abonamente AI, poate memoria să trăiască pe propriul Mac Mini, pe creditele incluse în abonamentul Google AI Pro, fără să depindă de un cont cu credite care se termină?

Ce s-a mutat (și cât de fidel)

560sesiuni de conversație
6.628mesaje, cu data originală
84.159concluzii derivate, cuvânt cu cuvânt
4peer cards, identice bit cu bit
1,26 GBbaza de date rezultată
0erori la migrare
Cum s-a evitat re-derivarea (economie ~20×)

În loc să trecem tot istoricul din nou prin LLM (~$5–15 și observații reformulate), concluziile gata derivate au fost exportate prin API și inserate direct în baza locală, cu ID-uri, timestamps și nivel păstrate. Singurul cost: recalcularea embeddings-urilor pe Vertex AI (~$3–4, un singur model pentru tot spațiul vectorial — cerință explicită din documentația Honcho). Mesajele s-au reimportat pe calea oficială („replay via normal application path”).

Duelul 1 · Aceleași 45 de întrebări, ambele memorii

Cinci categorii + cinci întrebări-capcană despre lucruri care nu există în memorie (testul de halucinație). Barele arată procentul de răspunsuri corecte pe categorie; apasă pe o întrebare ca să compari răspunsurile reale.

Verdictele: potrivire automată pe fapte-cheie + arbitraj manual pe răspunsurile complete. O întrebare a fost eliminată din scor (ground truth defect). Fiecare parte a avut victorii unice: localul a știut perfect STRIKE 1v1 și tenant-ul Răzvan/epgmktg (cloud-ul nu), cloud-ul a știut contabila UNEX și structura de prețuri (localul nu) — varianță de căutare internă, nu superioritate sistematică.

Duelul 2 · Căutarea semantică

20 de căutări identice; verde = primele 5 rezultate conțin conținutul așteptat. Aici cloud-ul a câștigat clar: 20/20 vs. 13/20 — plus 4 erori locale de quota (galben), toate în rafală.

De ce a pierdut localul aici (și ce e reparabil)

Cele 4 erori galbene: quota Vertex de embed_content tokens/minut, lovită de rafala de 40 de query-uri consecutive — se rezolvă cu o cerere de mărire de quota sau backoff în client, nu e un defect al arhitecturii. Cele 3 ratări de relevanță sunt însă reale: modelul de embeddings diferă (gemini-embedding-001 local vs. text-embedding-3-small pe cloud) și pe câteva query-uri scurte a adus rezultate mai slabe. Reparația de fond ar fi re-embedarea cu alt model — operațiune „destroy & rebuild” conform documentației.

Duelul 3 · Viteza

Fiecare punct = o întrebare dialectic. La mediană sunt egale; localul are coada mai lungă (p90).

Citirile pure sunt însă net mai rapide local: reprezentația în 0,02s vs. 0,33s, peer card în 0,01s vs. 0,17s — fără drum până în cloud.

Duelul 4 · Scrierea și prospețimea

☁ CLOUD
Mesaj nou acceptat în 0,74s — dar transformarea lui în memorie a depășit plafonul de 15 minute al testului: în față stătea backlog-ul de 1.823 de fragmente rămas din perioada fără credite. Memoria cloud abia acum se pune la zi, pe creditul reîncărcat.
⌂ LOCAL
Mesaj nou acceptat în 0,04s — derivarea vine în fereastra de grupare de ~30 de minute (setare intenționată: adună mărunțișul ca să coste puțin). Testul real de dinaintea studiului a derivat în ~35 min cu 0 erori. Fereastra e configurabilă la minute, dacă vrem memorie mai nervoasă.

Costurile, pe curat

☁ Cloud⌂ Local
Cost lunar de funcționare$13–25 (credite Honcho)$2–8 API brut — acoperit de creditul GDP de $10/lună din Google AI Pro
Costul migrării (o dată)~$4–5 (embeddings + test), fără re-derivare
Spațiu0 local1,26 GB DB + 0,9 GB cod (SSD) + 111 MB backup
Când se termină baniimemoria moare + rămâne în urmă (s-a întâmplat)derivarea așteaptă în coadă; citirile merg în continuare
Operarezero (a lor)2 procese + backup pg_dump — pe agenți
Datele și modelelela Plastic Labs, modele fixepe mașina ta, modele configurabile per funcție

Verdictul

Calitate: egalitate practică (85% vs. 82%), cu două rezerve oneste pentru local — o halucinație la capcane („ce mașină conduce Radu”) și un search mai slab pe 3 query-uri. Controlul, costul și imunitatea la „s-au terminat creditele” sunt ale localului; disciplina la capcane, search-ul impecabil și zero operare sunt ale cloud-ului.

Localul e gata de adopție după trei reparații punctuale:

  1. Quota Vertex mărită (sau backoff în client) — elimină clasa de erori 429 din search și dialectic.
  2. Delta-sync înainte de cutover — cloud-ul își termină acum backlog-ul pe creditul proaspăt; concluziile noi se re-exportă și se importă local cu aceeași rețetă (doar embeddings, bani mărunți).
  3. Curățarea peer card-urilor — faptele despre Radu consolidate pe peer-ul lui (azi contabila „locuiește” pe cardul lui hermes-main — de-asta localul n-a găsit-o la dialectic).

Plasa de siguranță rămâne întinsă: cloud-ul e neatins, backup-ul complet e pe SSD, iar rollback-ul = oprit 2 procese + repointat un URL.

Metodologie & limite

45 de întrebări dialectic (5 categorii × 8 + 5 capcane) și 20 de căutări, rulate alternat cloud/local în aceeași fereastră de timp; 5 extrageri de reprezentare per parte; test de ingestie cu sesiune dedicată, ștearsă după, pe ambele părți. Verdicte: potrivire automată pe fapte-cheie + arbitraj manual (Claude) pe răspunsurile complete; o întrebare eliminată (ground truth defect). Limite: o singură fereastră orară; cloud-ul procesa backlog în timpul testului (întrebările au vizat fapte istorice stabile, nu ultimele zile); modelele dialectic diferă între părți (config propriu local: gemini-2.5-flash pe Vertex); arbitrul e un singur model. Datele brute: bench-results/results.jsonl pe mini.