{"as_of":"2026-08-22T05:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0f253ed0a072c2f44ff62b5b54b375b4d33fabfd008fda605dc0aee41edc4cf2","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T08:16:51.419186Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.23403/citation-record","integrity":"/paper/2606.23403/integrity","json":"/paper/2606.23403/citation-record.json","paper":"/paper/2606.23403"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"InProceedings of the Thirty-Third International Joint Conference on Artificial Intelligence (IJCAI), pages 8038–8047","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:0e5c078150c9ee607b5e566746b8d4f3086f24cec9f3b1fbe4be9eea713de9a6","observation_id":"b9d634bb-1aa5-4246-b089-d41e889d9839","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"InIn- ternational Conference on Learning Representations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:bc39ff8cd888a257f2e7d5c11fe4f15f31d29e838e6ee76014782c40dfa51507","observation_id":"9385460b-5003-428e-a545-8412e7ab3789","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-18T02:44:37.072871Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:ec078f535786d4009a52999bbb6cdbbc30cd10f75ece2577112ac2cfe650b762","observation_id":"fe034b2e-076a-4f39-80f7-6982ff3fc2ce","resolution":{"observed_at":"2026-07-04T10:59:46.352976Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"In Proceedings of the 2022 Conference of the North American Chapter of the Association for Computa- tional Linguistics: Human Language Technologies, pages 314–324","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:dfa0b1d74ce151b12a7f51defe314b42c533c022ad722233eae49f442ce19c46","observation_id":"2082e843-62ca-4684-9400-bb47d41f987e","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"not found","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:e5f329e36bc2a41d0d0ccf9c41dd383ac415e936790ee2af44145844d5273303","observation_id":"d52e223a-0cb1-4576-a001-5fedc5bd7f90","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:6a605894bd09efc81d115ac1f5358f92aabf9b459ca7f28d5b26f03561eaa3d8","observation_id":"5244f29b-229b-4513-ae43-3bc6ff95b978","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:e61b64a18079fc35cebf38e19ed266921895564e30a237ebb04210e32c830d94","observation_id":"16bee449-ae78-40b0-b9c6-d332c5ab0223","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"PRIORITY ORDER:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:e4f3c5f4efa8e8121c81ba7bcfe72a4da174ed6540351a3cfd8a5b740c8579e4","observation_id":"afda7c72-b074-479c-8c7a-05c5df708c88","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:cd099fd86c74ed85e07aaa7349c6587d2ae18435b75d03f00f17ca2659ee9333","observation_id":"7c1d9e57-2039-4550-8310-ffc1bae4ceac","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"processing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:2454084463796937be49cf944ab8fb10e114db67784f2d7024a00b8830a88dc7","observation_id":"2d0fa759-220c-4de8-ae29-8d6348086d58","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:68087f41456607d4f4ac747758abe2d850e2dbb7a99ab069ba78c0f1fb1ef69d","observation_id":"acdfb9c5-657c-42a3-bdb4-9a6bd02725de","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:406eaf57ecd8876d7e2045e44a02f945e739e7365959a2ce3343a953d9a557b0","observation_id":"b9c59398-2666-4a3e-9e93-daecf62f81f2","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"Document Retrieval","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:93ff746b264830caac836f3030a00f94f1f808912a853143d52aa79725850d17","observation_id":"8695bb48-c448-4057-a74a-b90895b3facf","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:e07b003a07d47b74f575e9e89524cb6b2b52ea9333020cc17600cc967613bd9d","observation_id":"44e922b5-a7c7-4d71-b863-48a1084410be","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:15a067a89b1f7b7ca950f57be01ce9d0728ee65039752ba9dad05027b640d3c6","observation_id":"f5fc8336-46f6-49d0-9e24-5dc4c33582a1","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"If two groups of files implement different domain pipelines -- different domain vocabulary, inputs/outputs, or end- to-end flow -- they MUST be separate subsystems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:d70291f07fb684a4babd3ed3957943634e625b17bcde134aff3d86c0ff2f2c8c","observation_id":"7cb07c13-af5d-4c4b-a489-2a12244b03ea","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"Domain Logic","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:ed6b796ded89824238b3b5771983c7845694fcf8b30f0b533aeba5148947ec0c","observation_id":"2cd7a54a-3130-4d1c-b125-00506edf373a","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"Return ONLY valid JSON matching the schema","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:789e49c81777fdce93a65c6e824d89d3b9ff4c5d66d4bd3013089d97f1c16b11","observation_id":"1f345420-598f-4004-b90b-e477bc25b15b","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:6fc345efaeb05a29b87f1db12b9e5cd1d7d605d6287d9da6cad05158e2cb5447","observation_id":"7a79fa0f-8f4b-4cfd-8d8c-97e397e20827","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"data_flow: subsystemA.output -> subsystemB.input","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:193ce510d3129b10195bb170a0e48b639a92eb34a5f81fac4d1c3b89adb4ba6b","observation_id":"807d18ca-9631-486d-bb19-9c6fcc51a60c","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:0c8cd63a857462b2dcd9730f486a185af9ca36055f5969f66cad1368d6921791","observation_id":"c3e6600b-3916-401b-b08f-bd7229fbf228","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:744556559dd7547275474295bb497834d59d939d5db4847f2cf71a965a037fa2","observation_id":"77c09481-a0d1-4ef2-9722-f26b61a26030","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"No subsystem may be isolated","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:6406be2c11adf5edee41c6b00fed19fbd7be10164989dd7b6526dde3e5cdeffe","observation_id":"5f47d3c7-1e85-4b62-b9bf-0d3c67fef34f","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:96ed98fdfd7977a9c9e849473b48fb158d50f5abc138af6d22bacdea0db756d2","observation_id":"b61ac0cd-ed5a-497f-85f6-7e8bebae0ef2","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"Return ONLY valid JSON matching the schema","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:12015c70fb8fa9c1dc27bf222ad18c2a29ca5069ddb0ca29cd4b27870de2543e","observation_id":"e30329ae-cacf-4582-a9ed-ad82cbceba3f","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:5dbb97e2f0327ce9e988d1e5c9e8da7437ca455c8540d812226706c319744b83","observation_id":"dd0eee61-2bad-4d2c-a0e8-865a4f56c273","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:7f1ef18408b0b0552ed3037669ca7fe5a91134fb12b3672a55a1c7357fcbe70d","observation_id":"b763b471-171d-4914-8af5-d333d6f769a7","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:a769b12400a788c13e140578a7b2f8761bd0188a1d7032f51fcb91acb02961e6","observation_id":"4cdd8c16-b7e2-4b1f-984c-7b4eea37028d","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"ai_core","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:56cbd4e9fead34274cb15de1c8b3ff7ae9e93378b1597da17a92176f05f1a151","observation_id":"6472e3f6-b88d-4831-8885-a870903891a7","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"Assume the synthesizer made mistakes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:e799f8ea9af5258ff3bc37d16d0d96280612ed7ac5664b89c45842272a42d19a","observation_id":"d11d616b-2a2c-4889-8e48-6c96e5b3aa01","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:022885031509887e81e1067b6f4c468e32cc41cce28220b0bb582d2e3d8c6c70","observation_id":"00c3e734-0511-4f0c-83ac-39bfce00f771","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"prompt_chain","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:c962664755a64bd25d47d6cc2640368ab4f0bda353b015735589fd965208a861","observation_id":"a84e660d-0943-4e4f-9503-85d3a24a5251","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:bdc4f3d77670145dc555d52d0ea939049103668f897bbb40784c3d20b9f4c762","observation_id":"0a83fca3-0e48-4852-bf1e-5fff39f07afd","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:212a944c6cda08d894f33ce1c2644744d20c24e96a4931e0b3e0426fe90658ab","observation_id":"652eb75d-37e4-4f85-9157-c65d96496261","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:7058fe8c0d121c26edd2fd75220159cec8edd031d29739a24a661a06e2801f70","observation_id":"cc617c8b-cdb8-4667-b37f-b08ca2497a5e","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"evidence_match","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:6fed8fb975bde042dc5ab9b3ca1c41040f4596bf8cf861932bb0e73b9e57d6b5","observation_id":"47ef7195-539e-4717-b8a8-a48b7b4ad0b2","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"prompt_chain","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:1922a3295d6f4c8c396ab85d8cdb3676c630e20ce8097e65c371acacb4954424","observation_id":"ade26859-77f3-46e9-a01e-6d8147e510cf","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"none\" A component's pipelinePattern is INDEPENDENT of its patternStage -- e.g. a RAG retriever has pipelinePattern=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:91d26561f165750631cdb4d73345a631142f756605fd69ca92c7916ba3a56b76","observation_id":"2e7287a5-22c8-41d3-86a6-8e6d930c85eb","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:fced4fcae5d1a2dbd8e0767cab57cee82cdf0ac0311c772910cdbd8b5473638f","observation_id":"a5ee1ed8-f3f8-4ab5-9f8c-56df4023070e","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"non-empty retrieval result","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:4f527eb852dfea74a0ec7fd22c1a7aed995e6c384b09e70aceecd60df3c8495f","observation_id":"3253a48f-6c5b-4ed5-b218-0eb828497fcf","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"compare to ground truth","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:9e5e4eccdf9c0af41933e3c0719e4a693cbdf055d94a75d0bd80d932f2d42b90","observation_id":"a750804b-411d-462b-bd2c-eb44c578e8e3","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"function call count","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:d11ddcd5065672138c7253ecc28c8b960854137b32ad189c70b573ee886deb31","observation_id":"76caf7a8-d3b8-4f4b-9cc3-95bb2eca2dbb","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"Deterministic counters/ rates/percentiles already arrive via the PRE-CHOSEN METRICS block (user prompt) and are merged automatically -- do NOT duplicate them","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:e0ef43618f63a0c6f2331cbb558852a64f3b28c9f726d3f5bd9ae33fc3ef0c3f","observation_id":"0464f3e4-a418-4e2a-955c-72438513e414","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"accuracy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:3e12f3fe952fc54b89bc0cbda3c4f3ed5635739c3a2804068a33c9164e584aa5","observation_id":"335e1cb8-7128-4cce-a660-51e865c93e55","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"Relevancy and clarity are separate metrics, not one","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:36947a6b300f655dbeccc3467e55ec607179fe40185fbebf712c8ef40415f236","observation_id":"2597d384-b023-4bf1-86e2-350e94a0e0b4","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"Use LLM-as-Judge ONLY for semantic quality that cannot be computed deterministically","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:686a34446b322e2ff01befc17161d3ac2affdb73820a8766423c3e7b0580ba18","observation_id":"0dc9067b-b8f1-4d64-a2ed-3695d6883328","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:7a813d5c588d0fa0a7f0542853eb8935c5398b0844b3aaf7af799a00001eb55a","observation_id":"e4c9dc26-57a7-4447-ae3c-99ec0fefd729","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:0ee7f535544bdc96d3c435c9dab66d2bdae79e53729e4b426b8308f09c55d1a9","observation_id":"1eee4597-af8c-42f2-b874-a217bd99c790","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:5d89933b736d84495df13b7f670083ff0b3e3665c41acc91105894c392d4f276","observation_id":"279ca602-b6e4-482d-8297-0f9d904c0a4c","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"traceability = citation coverage + link strength + evidence breadth), design a composite metric with weighted sub-metrics and a formula","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:37b3c9f0ca1246954ae7e1da320aef23eccca041273da17afb4641c0842d6af2","observation_id":"cac67077-871d-49bb-b80b-4e757c05a2bf","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:09f0aa7e76c7a2d8d1fe2ccf7491f3b514c8c91ec1ebbdcb49e1c5cfc8eabcf6","observation_id":"ca64771c-3ae1-4a43-98cf-362df3cb83f6","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"Accuracy + Latency is NOT a valid composite","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:a2950b1a5ec7f91dbd8d73920e6cb24aa9d8ba43974cce630c51739935e44221","observation_id":"81304400-0d42-4a0a-a09a-ddbea6c588d7","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"X_grounding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:435bc6df1393e913a11a7e3701983914e349531670b392f7088f73d3472d71f2","observation_id":"f0ac5948-29d8-4cf0-ada2-4ce706463183","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"cost_per_quality","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:29395bb57894a542b96b91585b2ff6a38e7670431b0a8901c91aac158a0462b4","observation_id":"1e8f2ac2-3e51-49d6-b62d-c96be2a3b5d5","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"Explain how they correlate -- e.g","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:f5196e99bdaa65a9a27112db5fd38675dd53fb4b7a11eead8781cced9d66df55","observation_id":"206b15f9-735d-4138-bd4c-96a198d45b3a","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"For each gap, explain what is missing and suggest how to address it (e","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:1db02028e402e895043ffe6714696717c8c15b78524b19ee8323ea8cc0c91e57","observation_id":"5bb85000-6fc1-47c0-be44-ece3227d8ed7","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"> 500ms for 5 minutes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:a2ae888fecaf222f86c2a02bd57fa44da10390182df789b09dfdc328d38a5b37","observation_id":"683e5bfc-c23e-40b5-ac44-dd93c4e31b55","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:16:51.419186Z","title":"Reference actual source files when available","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:c23e8d57f41dea532dbcee83d449a87952d56c3c00cfe9e3679ae02be4aed220","observation_id":"f3112069-1aa5-4d8b-8814-4ae6c3e80c31","resolution":{"observed_at":"2026-06-26T08:16:51.419186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":57,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2606.23403."}