model-evaluation

Tested projects carrying the model-evaluation topic, with their current verdicts. Topics come from each project's own metadata and Argusic's pool tags. Spellings of the same topic are gathered here under one name, so this page holds every project tagged any of them.

Measured by Argusic on a fresh machine every time. Every number links to its evidence.

What Argusic measured in model-evaluation

Argusic installed and ran 1 model-evaluation project on clean machines: 1 only ran against stand-in services. Last tested October 4, 2026.

Every tested model-evaluation project

subjectverdictlanguagerunslast tested
future-agiRuns with mocksPython1

All tested projects: subjects.