This is a viewer only at the moment see the article on how this works.
To update the preview hit Ctrl-Alt-R (or ⌘-Alt-R on Mac) or Enter to refresh. The Save icon lets you save the markdown file to disk
This is a preview from the server running through my markdig pipeline
Wednesday, 19 November 2025
Varför jag skriver tester sist, och varför det inte är vad du tror att det betyder
**Kontroversiell användning:**Testdriven utveckling är en lysande praxis som löser fel problem för de flesta kreativa arbete.
De tre faserna av att bygga programvara (som faktiskt fungerar)
Så här bygger jag mjukvara.
Det är enkelt, det är effektivt, och det gör att TDD purister artigt får sina ögonbryn:
Få det att fungera.*Gör det vackert.*Lås den med testerna.
graph TB
Start[New Feature Request] --> P1[Phase 1: Make It Work]
P1 --> P1_Private[Private Exploration]
P1_Private --> P1_Sketch["Sketch the solution<br/>Messy code OK<br/>No tests yet<br/>Focus on learning"]
P1_Sketch --> P1_Run["Run it manually<br/>Try different inputs<br/>See what breaks<br/>Understand the problem"]
P1_Run --> P1_Decision{Does it work<br/>basically?}
P1_Decision -->|No| P1_Iterate[Try different approach]
P1_Iterate --> P1_Sketch
P1_Decision -->|Yes| P2
P2[Phase 2: Make It Pretty] --> P2_Refine[Private Refinement]
P2_Refine --> P2_Clean["Clean up the code<br/>Better names<br/>Type hints/annotations<br/>Clear structure"]
P2_Clean --> P2_Align["Align with spec<br/>Cover all requirements<br/>Handle edge cases<br/>Polish API surface"]
P2_Align --> P2_Optimise["Optimise<br/>Performance<br/>Readability<br/>Maintainability"]
P2_Optimise --> P3
P3[Phase 3: Lock It Down] --> P3_Share[Public Sharing]
P3_Share --> P3_Tests["Write comprehensive tests<br/>Full coverage<br/>Edge cases<br/>Error conditions"]
P3_Tests --> P3_CI["CI/CD Integration<br/>Automated testing<br/>Code review<br/>Documentation"]
P3_CI --> P3_Deploy["Ready to Share<br/>Commit to main<br/>Deploy to prod<br/>Other devs can use it"]
P3_Deploy --> Done[Well-Tested,<br/>Well-Designed Code]
style P1 stroke:#ff6b6b,stroke-width:3px
style P2 stroke:#4ecdc4,stroke-width:3px
style P3 stroke:#95e1d3,stroke-width:3px
style Done stroke:#38ada9,stroke-width:4px
I den ordningen.*Alltid.*Inte för att jag är lat.
Inte för att jag inte värdesätter tester.
Det är så här kreativt arbete faktiskt händer
När du utforskar ett problemutrymme förstår du inte riktigt än.
När du utforskar ett problemutrymme förstår du inte riktigt än.
Låt mig förklara.
Det här är den röriga delen.Jag har ingen aning om vad jag gör.
Jag försöker förstå:
Fungerar detta API verkligen som dokumenten hävdar?
Kan jag ens lösa detta problem med de verktyg jag har?
Vad betyder "korrekt" ens i detta sammanhang?*Är det två timmars problem eller två veckors problem?*Det här är en uppfinning.
Det här är utforskning.
Det här är jazz.
# Ugly, exploratory code
def process_thing(data):
# TODO: This is terrible, fix later
result = []
for item in data:
# Not sure if this is the right approach...
x = item.get('value')
if x: # Is this even the right condition?
result.append(x * 2) # Why multiply by 2? Testing something...
return result
Och vet du vad som dödar jazz?**Någon som står över axeln och säger "skriv provet först".**Varför inga prövningar ännu?
För att*Formen är fortfarande flytande.*Tänk dig att du är en skulptör.
Du har ett marmorblock och en vag idé: "Jag vill skära en fågel."
Definiera dess vingbredd.Ange vinkeln på varje fjäder.
Nu skära till dessa specifikationer."*Det är inte så fåglar blir snidade. (Eller programvara blir skriven, som det visar sig.)*Riktiga skulptörer
Skär ut blanketten först.De tecknar.
De gör maquettes.*De skär bort stora stenbitar för att hitta den allmänna formen.*Först senare förfinar de detaljerna.
Koden är densamma.
Denna kod är
Det är privat.
Det är ett samtal med mig själv.
Det är så jag listar ut vad "arbete" betyder.
aktivt skadligt.
För varje gång jag inser att "åh vänta, hela denna strategi är fel," skulle jag behöva skriva om testerna också.
Det är inte stelbent.
Friheten att misslyckas snabbt
# Before (Phase 1) - Exploratory code
def process_thing(data):
result = []
for item in data:
x = item.get('value')
if x:
result.append(x * 2)
return result
# After (Phase 2) - Refined code
def extract_doubled_values(items: list[dict]) -> list[int]:
"""Extract 'value' field from items and double each one.
Only includes items where 'value' is present and truthy.
"""
return [
item['value'] * 2
for item in items
if item.get('value')
]
Fas 1 handlar om
// Before (Phase 1) - Exploratory code
public List<int> ProcessThing(List<Dictionary<string, object>> data)
{
var result = new List<int>();
foreach (var item in data)
{
if (item.ContainsKey("value"))
{
var x = item["value"];
if (x != null)
{
result.Add(Convert.ToInt32(x) * 2);
}
}
}
return result;
}
// After (Phase 2) - Refined code
/// <summary>
/// Extracts 'value' field from items and doubles each one.
/// Only includes items where 'value' is present and non-null.
/// </summary>
public IEnumerable<int> ExtractDoubledValues(IEnumerable<IDictionary<string, object>> items)
{
return items
.Where(item => item.ContainsKey("value") && item["value"] != null)
.Select(item => Convert.ToInt32(item["value"]) * 2);
}
inlärningshastighet.
Jag måste upptäcka att det tredje partsbibliotek jag tänkte använda... inte är riktigt som det annonseras.*Jag måste inse att problemet jag löser inte är problemet.börVara lösa.*Testerna saktar ner det här.
Inte för att tester är långsamma, utan för att
Då är jag känslomässigt engagerad i fel sak.
Bättre att misslyckas snabbt, privat, utan några tester att upprätthålla och inget ego att skydda.Vad "arbete" innebär i fas 1Det betyder: " Jag körde den.
Jag gav det några ingångar.
# Phase 1: Works, but awkward to use
process_thing(data)
# Phase 2: Clear, flexible, composable
extract_doubled_values(
items,
scale_factor=2.0,
include_zeros=False
)
Det gav resultat som verkade rimliga.
// Phase 1: Works, but awkward to use
ProcessThing(data);
// Phase 2: Clear, flexible, composable
ExtractDoubledValues(
items,
scaleFactor: 2.0,
includeZeros: false
);
// Or even better with a fluent API
items.ExtractValues()
.Scale(by: 2.0)
.ExcludingZeros()
.ToList();
Jag är 60 % säker på att jag förstår problemet nu."
Så där ja.**Inga kantfall.**Ingen felhantering.
graph LR
subgraph "Phase 2 Refinement Process"
A[Rough Code] --> B[Clean Structure]
B --> C[Add Types]
C --> D[Polish API]
D --> E[Static Analysis]
E --> F{Quality Gates Pass?}
F -->|No| G[Fix Issues]
G --> B
F -->|Yes| H[Ready for Phase 3]
end
style A stroke:#ff6b6b,stroke-width:3px
style H stroke:#95e1d3,stroke-width:3px
*Bara en spik.*Ett bevis på koncept.
En skiss.Fas 2: Gör det vackert (Förfiningen)
Nu förstår jag problemet.Jag har något som fungerar, åtminstone för den lyckliga vägen.
Nu kan jag börja bry mig om kvalitet.
Exempel på Python:*C# Exempel:*Bättre namn.
Skriv anteckningar.*XML-dokumentation.*Genomförande av renare LINQ.
Anpassa dig till specifikationerna
Nu när jag vet vad jag faktiskt bygger, går jag tillbaka till de ursprungliga kraven och se till att jag löser
höger
aProblemet.
Ofta avslöjar detta luckor:
"Åh, de ville att detta skulle hantera negativa tal annorlunda."
erfarenhet.**- Vad är det? - Python:**C#: Vad är det?
Bättre namngivning.
Varför finns det fortfarande inga prövningar?
def test_extract_doubled_values_basic():
items = [{'value': 5}, {'value': 10}]
assert extract_doubled_values(items) == [10, 20]
def test_extract_doubled_values_skips_missing_values():
items = [{'value': 5}, {'name': 'foo'}, {'value': 3}]
assert extract_doubled_values(items) == [10, 6]
def test_extract_doubled_values_handles_zeros():
items = [{'value': 0}, {'value': 5}]
# By default, zeros are excluded (falsy)
assert extract_doubled_values(items) == [10]
def test_extract_doubled_values_includes_zeros_when_configured():
items = [{'value': 0}, {'value': 5}]
assert extract_doubled_values(items, include_zeros=True) == [0, 10]
def test_extract_doubled_values_custom_scale_factor():
items = [{'value': 5}]
assert extract_doubled_values(items, scale_factor=3.0) == [15.0]
def test_extract_doubled_values_rejects_negative_scale_factor():
with pytest.raises(ValueError):
extract_doubled_values([], scale_factor=-1.0)
def test_extract_doubled_values_handles_empty_list():
assert extract_doubled_values([]) == []
def test_extract_doubled_values_handles_non_numeric_values():
items = [{'value': 'not a number'}]
with pytest.raises(TypeError):
extract_doubled_values(items)
Jag sköter det hela tiden.
Jag har en REPL öppen.
För att
# This comment will drift from reality:
# Doubles all numeric values, skipping None
# This test will fail if reality changes:
def test_extract_doubled_values_skips_none_values():
items = [{'value': None}, {'value': 5}]
assert extract_doubled_values(items) == [10]
Jag upptäcker fortfarande vad som är värt att testa.
I fas 1 visste jag inte ens om den här funktionen skulle existera.I fas 2 upptäcker jag:"Åh, skalfaktorn kan inte vara negativ.
"Om listan är tom, bör vi återvända tomma, inte Inga.""Vi måste hantera icke-numeriska värden graciöst."
Dessa insikter
framträder från refaktoring.
De är inte uppenbara i förskott.
Koden är ren.*API:et är vettigt.*Jag har tagit hand om kanterna.
Nu skriver jag prov.
Massor av tester.
Så nära-full täckning-som-möjliga tester.Varför nu?
För att
Tester är en delningsmekanism.De är inte till mig längre.
Jag förstår redan denna kod intimt.
CI- pipelinen
(som måste förhindra regression)
Framtida utvecklare
Tester ärpresentationsskikt
för mitt genomförande.De innehåller följande dokument:
Vad denna kod görVilka indata som är giltigaVilka resultat att förvänta sig
Vilka antaganden jag gör
Fullständig täckning, inga kompromisser
Ändra denna funktion med tillförsikt
Tester som dokumentation
körbar dokumentation.
graph TB
subgraph "Traditional TDD (Red-Green-Refactor)"
TDD1[Write Failing Test] --> TDD2[Write Minimal Code to Pass]
TDD2 --> TDD3[Refactor]
TDD3 --> TDD1
end
subgraph "Three-Phase Approach (Explore-Refine-Lock)"
P1[Explore Solution Space] --> P2[Refine Implementation]
P2 --> P3[Write Comprehensive Tests]
P3 --> P4[Share With Team]
end
style TDD1 stroke:#ffaa00,stroke-width:2px
style TDD2 stroke:#ffaa00,stroke-width:2px
style TDD3 stroke:#ffaa00,stroke-width:2px
style P1 stroke:#ff6b6b,stroke-width:3px
style P2 stroke:#4ecdc4,stroke-width:3px
style P3 stroke:#95e1d3,stroke-width:3px
**Men jag skriver inte heller tester innan koden är klar att delas.**Faserna är följande:
Privat utforskning(bara jag, inga tester)
Privat förfining
(bara jag, fortfarande inga tester) |-----|-------------| Offentligt deltagande (test, CI, kodgranskning, hela nio varvet) Detta skyddar både min kreativitetoch | Mina lagkamraters mentala hälsa. Varför detta skyddar kreativiteten
Det är sant!Men bara om du redan vet vad du bygger.
När jag är i fas 1 behöver jag inte självförtroende för att refaktor.
Hour 1: Write test for API I haven't designed yet
Hour 2: Realize the API is wrong, rewrite test
Hour 3: Discover a better approach, rewrite both
Hour 4: Finally get it working
Hour 5: Rewrite tests to match what actually works
Jag behöver tillstånd att kasta bort allt.
Hour 1: Explore 3 different APIs, settle on the best one
Hour 2: Refine the implementation, handle edge cases
Hour 3: Write comprehensive tests for what I built
Hour 4: All tests pass, commit with confidence
Tester skapar psykologiska skulder.
Även om de testar fel sak.Genom att skjuta upp testerna till fas 3, behåller jag fas 1 och 2
Psykologiskt billigt.
Jag kan:
Upptäck problemet jag ärfaktisktlösning
Det är så kreativitet fungerar.
// Test 1: Write test first (but I don't know the right API yet)
[Test]
public void TestProcessData()
{
var processor = new DataProcessor();
var result = processor.Process(new[] { 1, 2, 3 });
Assert.That(result, Is.EqualTo(new[] { 2, 4, 6 }));
}
// Implementation 1: Make it pass
public class DataProcessor
{
public int[] Process(int[] data) => data.Select(x => x * 2).ToArray();
}
// Later: Realize I need configurability, rewrite test
[Test]
public void TestProcessDataWithFactor()
{
var processor = new DataProcessor();
var result = processor.Process(new[] { 1, 2, 3 }, factor: 3);
Assert.That(result, Is.EqualTo(new[] { 3, 6, 9 }));
}
// Later: Realize I should use IEnumerable, rewrite test again
[Test]
public void TestProcessDataEnumerable()
{
var processor = new DataProcessor();
var data = GetLargeDataset(); // This should be lazy
var result = processor.Process(data, factor: 3);
Assert.That(result.Take(3), Is.EqualTo(new[] { 3, 6, 9 }));
}
Du ritar löst först.
Du börjar inte med detaljerna.
// Phase 1: Explore (no tests yet)
public int[] ProcessThing(int[] data)
{
return data.Select(x => x * 2).ToArray();
}
// Try it: var result = ProcessThing(new[] { 1, 2, 3 });
// Hmm, what about configurability? What about lazy evaluation?
// Phase 2: Refine (still no tests)
public static class DataProcessorExtensions
{
public static IEnumerable<int> Scale(
this IEnumerable<int> source,
int factor = 2)
{
return source.Select(x => x * factor);
}
}
// Try it: var result = data.Scale(factor: 3).ToList();
// Much better API!
// Phase 3: Lock it down (NOW write tests, correctly)
[TestFixture]
public class DataProcessorTests
{
[Test]
public void Scale_DefaultFactor_DoublesValues()
{
var result = new[] { 1, 2, 3 }.Scale();
Assert.That(result, Is.EqualTo(new[] { 2, 4, 6 }));
}
[Test]
public void Scale_CustomFactor_ScalesCorrectly()
{
var result = new[] { 1, 2, 3 }.Scale(factor: 3);
Assert.That(result, Is.EqualTo(new[] { 3, 6, 9 }));
}
[Test]
public void Scale_LazyEvaluation_DoesNotEnumerateImmediately()
{
var enumerated = false;
var data = GetTestData(() => enumerated = true);
var scaled = data.Scale(factor: 2);
Assert.That(enumerated, Is.False, "Should not enumerate yet");
scaled.ToList();
Assert.That(enumerated, Is.True, "Should enumerate on materialization");
}
[Test]
public void Scale_EmptySequence_ReturnsEmpty()
{
var result = Enumerable.Empty<int>().Scale();
Assert.That(result, Is.Empty);
}
}
Hur detta passar med Agile och XP (Och där det avviker)
Detta är inte "test senare utveckling".
Det här är
Att lägga till enhetstester är kritiskt.
De XP - metoder jag håller
Varje funktion går igenom CI innan sammanslagning
Samverkansförfining förbättrar designenEnkel design
Fas 2 är
Tillverkning
Fas 2 är dedikerad refaktortidRengör kodenföre
**Tester skyddar refaktorn (i fas 3+)**Där jag avviker från strikt TDD
TDD säger:"Test först.
Alltid.Red-Green-Refaktor är det enda sättet."
Jag säger:"Testar när man vet vad man testar.
Explore-Refine-Lock är mer naturligt."
TDD på trefastill Test definierar gränssnittet på Exploration definierar gränssnittet på
Pröva först för allt och testa vid rätt tidpunkt för varje sak
Rätt tidpunkt (fas 3):
Samma kvalitetsresultat.*Hälften av churn.*Detta är agilt
"Skjut om att ändra sig efter en plan."TDD kan bli sin egen form av planuppföljning.
När du har skrivit prov, är du psykologiskt engagerad i den designen.
Det här ärfler
Kontrasterande metoder: Ett exempel på C#
Lägger du märke till churnen?
Tre test omskriver som designen utvecklats.
Kom ihåg värdena:
Fas 1 kommer till arbetsprogramvaran
snabb
Samarbeta när det hjälper (fas 2-3), utforska ensam när det inte gör det (fas 1)
Fas 2 ligger i linje med specifikationerna
efter
Därför att:
Du kände inte till de bästa fallen än.Du upptäckte en bättre API-designDu insåg att funktionen inte behövdes alls
Varje test du skriver i fas 1 är förmodligen bortkastad ansträngning.
en
uppsättning tester i fas 3, när du faktiskt vet vad du bygger, än att skriva-skriva-skriva-skriva om under utforskning.TDD-löftet mot verklighetenTDD lovar:
"Write code that solves the specification.
Don't worry about perfection yet.
Just get it working."
"Tests kör din design!
Nu skriver jag om både testerna och koden."**Det är inte design.**Det är
Knuffas.Mitt tillvägagångssätt:
Designa genom implementation, sedan låsa ner den med tester.
"Inga tester"*"Skicka och be"*När jag är klar med fas 3 har min kod:
Omfattande testtäckningHandläggning av kantfall
Rensa API-designDokumentation (via tester)
Exakt samma som TDD.
Skillnaden är
Regeln är enkel:
- flake8 (style checking)
- pylint (code quality)
- mypy (type checking)
- black (formatting)
- radon (complexity analysis)
**Ingen kod lämnar fas 2 utan fas 3.**Jag vet inte:
for iteration in range(3):
# Measure current performance
metrics = measure_performance(code)
# Generate improved version
better_code = optimise(code, metrics)
# Keep if better, discard if worse
if better_code.score > code.score:
code = better_code
Kommit oprövad kodÖppna PR utan testerSammanfoga till huvud utan att CI passerar
Det här är ingen ny idé.Det är så kreativt arbete alltid har fungerat:
Målare börjar inte med de sista penseldragen.*De har följande egenskaper:*SkissSammansättningen (fas 1)
Färg*skikten (fas 2)*Varniska
# Test generation happens AFTER optimisation
def generate_unit_tests(specification, optimized_code):
"""Generate comprehensive tests for refined code.
This happens in Phase 3, after we know:
- What the code actually does
- What edge cases exist
- What the API surface looks like
"""
return llm.generate(
f"""Generate comprehensive unit tests for this code.
Specification: {specification}
Implementation: {optimized_code}
Include tests for:
- Happy path (from spec examples)
- Edge cases (discovered during optimisation)
- Error conditions (based on actual error handling)
- Performance bounds (based on measured metrics)
"""
)
att skydda och presentera (fas 3)
De har följande egenskaper:Utkaststökigt (fas 1)
**för hållbarhet (fas 3)**Glasyren är avgörande.
Hur detta kartor till DiSE Codegen PipelineHär blir det intressant: Jag har faktisktGenomförande
denna filosofi i systemet DiSE (Dired Synthetic Evolution).
Generator
Ingen för tidig optimering
Försök igen med högre kreativitet (högre temperatur)
User: "Calculate fibonacci numbers"
[Phase 1: Exploration - 3 attempts]
Attempt 1: Works for small inputs, explodes on large ones (no safety limit)
Attempt 2: Adds safety limit, but inefficient recursive approach
Attempt 3: Switches to iterative DP (PASS)
[Phase 2: Optimization - 3 iterations]
Iteration 1: Add type hints, improve naming (Score: 1.05)
Iteration 2: Optimize memory usage with generator (Score: 1.10)
Iteration 3: Add input validation (Score: 1.15)
[Phase 3: Testing and Storage]
Generated 8 unit tests covering:
- Basic cases (n=0, n=1, n=5, n=10)
- Edge cases (n=negative, n=100, n=None)
- Type validation
All tests pass ✓
Stored in RAG with quality score: 1.15
Available for reuse: YES
Rulla vidare till en kraftfullare modell
exaktFas 1 .
Inga tester skrivs under denna fas.Koden är privat till generationsprocessen.
Fas 2 i diSE: OptimeringsstadietNär koden passerar grundläggande utförande, DiSE flyttar tillOptimering.
(3 iterationer som standard)
Det här ärexakt
Koden är fortfarande privat (inte i registret ännu), men vi polerar den:Bättre namn
Skriv tipsRenare struktur
Lägre komplexitet
Bättre resultatFormen är inte längre flytande.
Vi vet vad vi bygger.
formella enhetsprovningar.
Testerna omfattar följande:*Exempel på specificering (korrekthet)*Kantfall upptäckta under fas 2
Prestandaegenskaper som mättesOch senEndast om proven godkänns
, koden är:
RAG-minne
# I know what sort() should do. Tests first? Sure!
def test_sort_empty_list():
assert sort([]) == []
def test_sort_single_element():
assert sort([5]) == [5]
def test_sort_multiple_elements():
assert sort([3, 1, 2]) == [1, 2, 3]
Tillagd tillNodregister:
i framtida arbetsflöden
kvalitetspoäng
© 2026 Scott Galloway — Unlicense — All content and source code on this site is free to use, copy, modify, and sell.