Modele, których nie kupisz
Laboratoria AI używają najlepszych modeli u siebie — do matematyki, leków i fizyki — zanim je sprzedadzą. Co mówią liczby z września 2026 o tej przewadze. (151)
Autor: Konrad — CEO
Read in EnglishW TYM ARTYKULE
6 września OpenAI opublikowało notatkę o tym, jak pracuje jego własny dział badań: mediana badacza zużywa ponad 600 dolarów dziennie w tokenach, dziewięćdziesiąty percentyl — ponad 7 tysięcy dolarów dziennie, a na każdy dzień pracy człowieka przypada 3,1 dnia pracy agentów [1].
Ile naprawdę wyprzedzają nas modele wewnętrzne
Jedyny pomiar, jaki istnieje, zrobił METR: cztery laboratoria (OpenAI, Anthropic, Google, Meta) udostępniły mu w lutym i marcu swoje wewnętrzne modele i uznał, że wewnętrzna czołówka jest „średnio około 2 miesiące" przed publiczną [2]. Niektórzy analitycy rynku AI szacują, że to 3–4 miesiące dla modeli po post-treningu (do pół roku dla surowych checkpointów), inni określają to jako „dwie generacje".
Dziesięć wyników matematycznych, które OpenAI ogłosiło 1 sierpnia, pochodziło z „wewnętrznej wersji Astry"; Astra trafiła do sprzedaży 3 września, 33 dni później [3][4]. Aby te wyniki przygotować i policzyć, musiała wewnętrznie być już dostępna przez jakiś czas, obstawiam, że minimum miesiąc.
Formalizację wielkiego twierdzenia Fermata Claude zrobił między 7 a 18 sierpnia na „wewnętrznym modelu badawczym porównywalnym z Fable 5.1"; Fable 5.1 wyszedł 1 września [5].
Mocy obliczeniowej brakuje, a ta, która jest, więcej zarabia w środku
Sarah Friar, CFO OpenAI, w kwietniu powiedziała: „są rzeczy, których nie robimy, bo nie mamy dość mocy obliczeniowej" [6].
Dołóżmy do tego, że jeśli policzyć wartość przyszłą tokena, to token wydany na ulepszanie własnego modelu jest prawdopodobnie wart więcej niż token sprzedany klientowi na generowanie kodu, więc moc popłynie do samodoskonalenia, nie do klientów.
Zgadza się to z prognozą AI 2027 (udział mocy sprzedawanej na zewnątrz spada z około 30% w 2024 do 13% w 2027 [7]) i z liczbami z notatki OpenAI, od której zacząłem. Jeśli masz jedną łopatę, a na twoim podwórku znalazłeś złoto, nie wynajmujesz jej sąsiadowi.
Ale chodzi nie tylko o ulepszanie modeli.
Zmiana narracji: z odbierania ludziom pracy na odkrycia
Skoro o narracji, to przyjrzyjmy się, co mówią CEO największych graczy. 27 maja Altman: „cieszę się, że się myliłem" — spodziewał się większego uderzenia w stanowiska juniorskie [8]. 12 lipca: AI jest „raczej" netto twórcą miejsc pracy [9]. 25 sierpnia, u Davida Senry: „wszyscy byliśmy zbyt ambitni co do terminów", gospodarka ma bezwładność i dobrze [10]. 26 sierpnia, w TIME, o Astrze: „spodziewam się, że to będzie pierwszy model, który naprawdę wymyśla nowe rzeczy w sposób, który ma znaczenie" [11]. Amodei 15 sierpnia: obiecywanie, że AI wyleczy raka, „jest dziś bardziej banałem niż inspiracją… zadziała faktyczne wyleczenie raka" [12]. Zuckerberg 10 sierpnia: „Wynalazczość, nie automatyzacja, będzie największym wkładem superinteligencji" [13].
Rok temu największą ambicją AI było zabrać nam pracę, a „w mgnieniu oka przeszło to w: nie obchodzi mnie twoja praca, mam poważniejsze zadania".
Jeśli firma może zarabiać na nowych lekach, nowej fizyce, materiałach i energii, to nie musi zarabiać na zastępowaniu ludzi w biurach — to są ogromne rynki i mniej wyborców do rozzłoszczenia (71% Amerykanów nie chce centrum danych w swojej okolicy [14]). Zmiana tematu jest widoczna, zmiana modelu biznesowego wcale może nie być taka łatwa.
Matematyka już przyspieszyła
Astra, czyli GPT-6, wyszła 3 września. Na FrontierMath Tier 4ᵃ, najtrudniejszym zamkniętym benchmarku matematycznym, ma 97,6% [4]. Na nowym benchmarku Epoch — 68 otwartych problemów Erdősa — rozwiązała dwa [15].
Dzień później Anthropic ogłosił, że Claude sformalizował w Leanieᵇ wielkie twierdzenie Fermata: 13 milionów linii, ponad 30 tysięcy twierdzeń, 11 dni, około 6 miliardów tokenów [5].
Dziesięć wyników OpenAI z sierpnia stoi na twierdzeniach Gábora Kuna i Kuna–Thoma z budapeszteńskiego Instytutu Rényiego [16]; majowy wynik z problemem Erdősa weryfikowali Alon, Gowers, Shankar, Tsimerman i Bloom [17]; kod Fermata czytał Buzzard [18]; kontrprzykład do hipotezy Jacobiego i dowód hipotezy Sendova „trawił" Terence Tao [19]. Tao opisał to na kongresie ICM jako trzy etapy — generowanie, weryfikacja, zrozumienie — z których AI przyspiesza dwa pierwsze, a trzeci zostaje ludziom [20].
Dlatego laboratoria kupują tych ludzi: John Jumper (Nobel za AlphaFold) przeszedł do Anthropica, Alpöge i Furman sprawdzają tam dowody Claude'a, fizyk czarnych dziur Lupsasca pracuje w OpenAI for Science, Harmonic płaci matematykom stypendia, Axiom publikuje z Kenem Ono [21]. Model generuje. Człowiek wybiera pytanie, sprawdza i rozumie. I dostaje za to pensję, którą laboratorium płaci bez mrugnięcia okiem. Stać ich.
Anthropic idzie w biologię
Anthropic w tym roku otwiera laboratoria (wet labs) i rekrutuje biologów, przejmuje Coefficient Bio (według doniesień około 400 mln dolarów w akcjach), ściąga Johna Jumpera (czerwiec), uruchamia Claude Science i własny program odkrywania leków na choroby rzadkie (30 czerwca), a 1 września udostępnia Mythos 5.1 z odblokowanymi zabezpieczeniami biologicznymi tylko dla zweryfikowanych organizacji, „we współpracy z rządem USA". Do tego pokazuje projektowanie białek z około 50% trafnością wobec typowych 10–15% [22][23]. CEO Amodei obiecuje „niesamowite wyniki w nadchodzących miesiącach" [12].
To na razie dopiero początek. Mamy obecnie jeden lek zaprojektowany przez AI w III fazie (rentosertib Insilico, od lipca) [24], zero zatwierdzonych, a cząsteczki z AI przechodzą fazę I w 80–90% przypadków i fazę II w około 40% — tyle, co zwykłe [25].
AI poprawia chemię. Biologii jeszcze nie. Na razie.
Co leży na biurku Sama i Dario?
3 września: „nadchodzą dużo, dużo, dużo zdolniejsze modele" (Sam Altman) [26]. Jeśli publicznie dostajemy Fable 5.1, chwilę później Astrę, to co OpenAI czy Anthropic mają już dostępne? Czy kiedykolwiek się dowiemy? Prawdopodobnie, ale to tylko opinia, najlepszych modeli i superinteligencji ot tak nie kupimy w subskrypcji. Może to i lepiej.
Objaśnienia terminów
ᵃ FrontierMath Tier 4 — najtrudniejszy poziom benchmarku matematycznego Epoch AI (zadania na poziomie badawczym); wersja v2 z czerwca 2026 poprawiła błędy w około 42% zadań. OpenAI finansowało benchmark i ma wyłączny dostęp do części zadań — Epoch sam to ujawnia.
ᵇ Lean — asystent dowodzenia. Dowód „sprawdzony w Leanie" oznacza, że komputer zweryfikował każdy krok od aksjomatów; nie oznacza, że dowód jest czytelny dla ludzi ani nowy.
Źródła
[1] OpenAI — „Research acceleration: The view inside OpenAI" (6 IX 2026): wydatki badaczy na tokeny, 3,1 dnia pracy agentów na dzień pracy człowieka, osiągnięty cel „stażysty badawczego": https://openai.com/index/research-acceleration-view-inside-openai/
[2] METR — Frontier Risk Report (19 V 2026): pomiar przewagi modeli wewnętrznych nad publicznymi („średnio około 2 miesiące"): https://metr.org/blog/2026-05-19-frontier-risk-report/
[3] OpenAI — „Ten advances in mathematics and theoretical computer science" (1 VIII 2026): wyniki „wewnętrznej wersji Astry": https://openai.com/index/ten-advances-in-mathematics/
[4] OpenAI — GPT-6 Astra (3 IX 2026): premiera, wynik 97,6% na FrontierMath Tier 4: https://openai.com/index/gpt-6-astra/
[5] Anthropic — „Formalizing Fermat's Last Theorem" (4 IX 2026): 13 mln linii Leana, 30 300 twierdzeń, 11 dni, ~6 mld tokenów, wewnętrzny model badawczy: https://www.anthropic.com/research/formalizing-fermats-last-theorem
[6] Business Insider (via AOL) — Sarah Friar o braku mocy obliczeniowej (2 IV 2026): https://www.aol.com/articles/openais-cfo-says-company-passing-112355988.html
[7] AI 2027 — Compute Forecast: podział mocy obliczeniowej laboratorium w 2024 i 2027: https://ai-2027.com/research/compute-forecast
[8] The Decoder — Altman i Amodei wycofują prognozy o pracy (27 V 2026): https://the-decoder.com/sam-altman-and-dario-amodei-walk-back-their-ai-job-apocalypse-predictions/
[9] The Decoder — Altman: AI netto tworzy miejsca pracy (12 VII 2026): https://the-decoder.com/openai-ceo-altman-is-now-pretty-sure-ai-is-net-job-creating-which-is-quite-the-pivot-from-predicting-mass-layoffs/
[10] The Next Web — Altman u Davida Senry o zbyt ambitnych terminach (25 VIII 2026): https://thenextweb.com/news/sam-altman-ai-timelines-wrong-inertia-senra-podcast
[11] TIME — „Inside OpenAI's Reboot" (26 VIII 2026): Altman o Astrze i AGI do końca roku: https://time.com/article/2026/08/26/openai-sam-altman-interview/
[12] TechCrunch — Amodei o „kryzysie zaufania" i leczeniu raka (16 VIII 2026): https://techcrunch.com/2026/08/16/anthropic-ceo-says-ai-backlash-is-fundamentally-a-crisis-of-trust/
[13] Meta — Mark Zuckerberg, „The Future is for Everyone" (10 VIII 2026): https://about.fb.com/news/2026/08/the-future-is-for-everyone/
[14] Gallup — 71% Amerykanów przeciw centrum danych w okolicy (14 V 2026): https://news.gallup.com/poll/708620/less-support-solar-wind-energy-nuclear.aspx
[15] Epoch AI — „Announcing FrontierMath Erdős" (1 IX 2026): 68 otwartych problemów Erdősa, Astra 2/68, pozostałe modele 0: https://epoch.ai/latest/announcing-frontiermath-erdos
[16] HUN-REN Instytut Rényiego — o twierdzeniach Kuna i Kuna–Thoma w dowodzie OpenAI (4 VIII 2026): https://www.renyi.hu/en/news/openai-mathematical-breakthrough-builds-renyi-researchers-work
[17] OpenAI — obalenie hipotezy Erdősa o odległościach jednostkowych (20 V 2026), z weryfikacją Alona, Gowersa, Shankara, Tsimermana i Blooma: https://openai.com/index/model-disproves-discrete-geometry-conjecture/ ; Quanta Magazine — „Why the Legendary Erdős Problems Are Falling to AI" (3 VIII 2026): https://www.quantamagazine.org/why-the-legendary-erdos-problems-are-falling-to-ai-20260803/
[18] Kevin Buzzard — „FLT: Anthropic has beaten me to it" (4 IX 2026): https://xenaproject.wordpress.com/2026/09/04/flt-anthropic-has-beaten-me-to-it/
[19] Terence Tao — „A digestion of the Jacobian conjecture counterexample" (21 VII 2026): https://terrytao.wordpress.com/2026/07/21/a-digestion-of-the-jacobian-conjecture-counterexample/ ; „A digestion of the proof of Sendov's conjecture" (12 VIII 2026): https://terrytao.wordpress.com/2026/08/12/a-digestion-of-the-proof-of-sendovs-conjecture/
[20] Terence Tao — „Mathematics in the age of AI", arXiv 2608.16753 (wykład na ICM, 24 VII 2026): https://arxiv.org/abs/2608.16753
[21] TechCrunch — John Jumper przechodzi do Anthropica (20 VI 2026): https://techcrunch.com/2026/06/20/nobel-laureate-john-jumper-is-leaving-deepmind-for-rival-anthropic/ ; Anthropic — Alpöge i Furman weryfikują wynik Claude'a (10 VIII 2026): https://www.anthropic.com/research/riemann-zeta ; Latent Space — Alex Lupsasca w OpenAI for Science (5 V 2026): https://www.latent.space/p/lupsasca ; Harmonic — stypendia dla matematyków (22 I 2026): https://www.harmonic.fun/news/mathematician-sponsorships/ ; Axiom Math — publikacja z Kenem Ono (18 VIII 2026): https://axiommath.ai/research/the-weight-comes-last/
[22] SynBioBeta — Anthropic otwiera laboratoria i rekrutuje biologów (7 V 2026): https://www.synbiobeta.com/read/anthropic-is-hiring-biologists-building-wet-labs-and-betting-big-on-drug-discovery ; BioSpace — przejęcie Coefficient Bio (6 IV 2026): https://www.biospace.com/business/ai-giant-anthropic-leans-into-life-sciences-with-400m-coefficient-bio-catch ; MIT Technology Review — Claude Science i program odkrywania leków (30 VI 2026): https://www.technologyreview.com/2026/06/30/1139987/claude-science-is-anthropics-newest-flagship-product/
[23] Anthropic — Claude Fable 5.1 i Mythos 5.1 (1 IX 2026): Life Sciences Verification Program, projektowanie białek: https://www.anthropic.com/claude-fable-and-mythos-5-1
[24] Insilico Medicine — start III fazy badań rentosertibu (7 VII 2026): https://www.prnewswire.com/news-releases/insilico-initiates-phase-iii-clinical-trial-for-rentosertib-its-ai-empowered-tnik-inhibitor-for-idiopathic-pulmonary-fibrosis-302819553.html
[25] Jayatunga i in. — „How successful are AI-discovered drugs in clinical trials? A first analysis and emerging lessons", Drug Discovery Today 2024, DOI 10.1016/j.drudis.2024.104009
[26] Axios — wywiad z Samem Altmanem (3 IX 2026): https://www.axios.com/2026/09/03/axios-interview-sam-altmans-sobering-siren
