Compare / Meta Muse vs Instinct

Meta Muse vs Instinct

Meta Muse is a persistent personal agent from Meta (United States); Instinct is an Universal Personal Execution Agent from Instinct (Spear Street Technology) (United States). On Assistant Benchmark (1–10, updated 8 Oct 2026), Meta Muse scores 9.3 over 8 dimensions and Instinct scores 8.5 over 12; both were scored on 8 of the same dimensions, shown below. In micro1 PersonalAgentBench, Meta Muse completed 2 of 10 workflows with trusted completion and Instinct 4 of 10; the 95% intervals (6–51% and 17–69%) overlap, so the difference is not statistically separated. PAEval holds 30 capability records for Meta Muse and 15 for Instinct (as of 9 Oct 2026).

Scores stay on each evaluator's own scale and are never combined. PAEval does not pick a winner.

Meta MuseInstinct
VendorMetaInstinct (Spear Street Technology)
HQ regionUnited StatesUnited States
TypePersistent personal agentUniversal Personal Execution Agent
Pricing (as documented)Free has a limit; Power is US$20/month, 500M Muse tokens/week; Maximum is US$100/month, 3B/week; automatic monthly renewal.Not compiled
Assistant Benchmark1–10 mean of scored dimensions9.3coverage 8/158.5coverage 12/15
micro1 PersonalAgentBench% of 10 workflows with trusted completion20%95% CI 6–51%40%95% CI 17–69%
SuperCLUE-XClaw0–100 weighted total of 5 dimensionsNot scoredNot scored
Autonomy & background workDocumentedIndependently observed
Execution environmentsDocumentedDocumented
Calls, messages & identityLimited or conditionalDocumented
Connectors & toolsDocumentedDocumented
Memory & personalizationDocumentedDocumented
Channels & interfacesDocumentedDocumented
Research & deliverablesDocumentedNot disclosed
Transactions & bookingsLimited or conditionalNo record
Collaboration & parallelismDocumentedPartly disclosed / partly tested
Reliability & recoveryLimited or conditionalPartly disclosed / partly tested
Permissions, security & dataLimited or conditionalDocumented
Capability records30 (0 independent)15 (3 independent)
Capability cells show the strongest documented or observed status in each domain; availability is not task success.Add more products →

Assistant Benchmark, dimension by dimension

Meta MuseInstinct
Carrying out an online task9test8observed in use
Travel booking7observed in use10observed in use
Recommendation quality9test9observed in use
Purchasing a product10observed in use9observed in use
Responding to emails10observed in use9observed in use
Proactive behaviorNot tested8observed in use
Running a routine10observed in use10test
Third-party integrations10observed in use8observed in use
Permissions & privacy9observed in use5observed in use
MemoryNot tested9observed in use
Phone callsNot testedNot tested
Multiplayer / groupsNot tested9unlabelled
Chained tasksNot testedNot tested
Proactive restraintNot tested8observed in use
Content creation / gamesNot testedNot tested
Source scores on the 1–10 anchor scale. "Not tested" is missing evidence, not zero.Source ↗