{"as_of":"2026-08-10T15:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4bbf323536101e38ba33af8fd4d3672863a13073550cb1c6f8299a7133e51a19","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:32:33.493899Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.02204/citation-record","integrity":"/paper/2506.02204/integrity","json":"/paper/2506.02204/citation-record.json","paper":"/paper/2506.02204"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2001.09977","last_updated":"2020-02-27T07:36:47Z","snapshot_observed_at":"2026-08-04T13:03:06.820772Z","submitted_at":"2020-01-27T18:53:15Z","title":"Towards a Human-like Open-Domain Chatbot","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.09977","snapshot_observed_at":"2026-08-07T11:32:30.387732Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:30.387732Z"},"links":{"cited_paper":"/paper/2001.09977","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:62ebf6a3c12c8ec4d06386128badd95091b740bcd856c666e0d2eb9a3f302d97","observation_id":"b90793ed-24ab-4917-8a99-217bcf350a10","resolution":{"observed_at":"2026-08-07T11:32:30.387732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.08375","last_updated":"2026-04-14T12:21:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-22T14:30:17Z","title":"Deep Learning using Rectified Linear Units (ReLU)","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.08375","snapshot_observed_at":"2026-08-07T11:32:30.455420Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:30.455420Z"},"links":{"cited_paper":"/paper/1803.08375","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:7d18bb03529e16e03d6bc7a94698269d3ee74eff026ec11f7f71ee9c052fb5c3","observation_id":"5ca4bc87-a907-4082-8d4f-d66e771a238a","resolution":{"observed_at":"2026-08-07T11:32:30.455420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:30.509887Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:30.509887Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:952628816202424732812e26507cc00357555c7e118fec1e9a9d0d5e0894f034","observation_id":"6a5507af-5736-479d-8989-2b5039181798","resolution":{"observed_at":"2026-08-07T11:32:30.509887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:35.630923Z","title":null,"venue":null,"work_id":"dcb58a34-6524-45ce-968e-65a35f44a715","year":2022},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:30.576646Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:21cf317a80159202991ba0340a6ebfbf973b979a42d9b61e1582e9d3b030d1ab","observation_id":"9c9effec-752e-41ff-b8ca-4e86bc3f5c03","resolution":{"observed_at":"2026-08-07T11:32:35.720342Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-07T11:32:30.646154Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:30.646154Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:8b63e3e7ab0473df7c0d4be152bb915256acf971a35d95885cdebb2f0ac88734","observation_id":"b6faf503-bc86-4292-8c59-28f7bcbff349","resolution":{"observed_at":"2026-08-07T11:32:30.646154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:30.729007Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:30.729007Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:84efb908fd8e178bca4d934fd65456ed244693f1253a8b8fc81540a7290250aa","observation_id":"2c9f37c8-11f3-4e93-a8a5-a72c350a845d","resolution":{"observed_at":"2026-08-07T11:32:30.729007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:30.796810Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:30.796810Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:0d4e3ea243608c23806ba99f7c7c3cce613ac786d0d9fab43be0eaffec41c11b","observation_id":"d6d454d3-a0ed-4d90-9b7c-d361db7b2ac0","resolution":{"observed_at":"2026-08-07T11:32:30.796810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:35.347079Z","title":null,"venue":null,"work_id":"6067c050-0283-46c9-867e-a97a713da519","year":2016},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:30.871280Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:72d6ef2d7117ac7c97d9eaa7063764bab391e5ed2f039f8b378e3b0ff11dcf3e","observation_id":"a4d4c44b-623a-45b9-97a3-34b36e511d73","resolution":{"observed_at":"2026-08-07T11:32:35.496121Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:34.937316Z","title":null,"venue":null,"work_id":"cc97eb0e-b3a9-491b-b802-b69121a2059b","year":2018},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:30.983742Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:bf71f23f3518f0b1d0245ec63ab03f525d449dcf6ac84ea4de34594fc54d8ff9","observation_id":"00a006ad-9958-457f-9968-40686622c1fd","resolution":{"observed_at":"2026-08-07T11:32:35.144336Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08600","last_updated":"2023-10-04T13:17:38Z","snapshot_observed_at":"2026-07-06T16:19:05.495349Z","submitted_at":"2023-09-15T17:56:55Z","title":"Sparse Autoencoders Find Highly Interpretable Features in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08600","snapshot_observed_at":"2026-08-07T11:32:31.101286Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:31.101286Z"},"links":{"cited_paper":"/paper/2309.08600","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:db9910567d2ce1bbde34d4dc2b61be5176273cc68836aadd3bb429081440dc47","observation_id":"9356aa0c-0fee-42e6-94c6-bfbb2286f6f7","resolution":{"observed_at":"2026-08-07T11:32:31.101286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:31.174897Z","title":"Wright, and Kevin Leyton-Brown","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:31.174897Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:e34d7d16aa0eb0eaac92b1e55832ea3da3d0e035b6fcbc574cc9432274f3a260","observation_id":"3c54bee8-b03c-4552-9f7a-20877cfb7a98","resolution":{"observed_at":"2026-08-07T11:32:31.174897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:34.713677Z","title":null,"venue":null,"work_id":"5c9c6af1-f51f-456d-a595-376ef4544734","year":2022},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:31.257042Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:c5a1ddab75a798306bd34954b3624c22034ac7840e25a994ac006fdb69f1a55e","observation_id":"e959c9fa-49a5-4842-ac69-b31d7f666ad1","resolution":{"observed_at":"2026-08-07T11:32:34.775043Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23771","last_updated":"2025-07-27T14:45:02Z","snapshot_observed_at":"2026-08-03T10:49:26.615197Z","submitted_at":"2024-10-31T09:39:28Z","title":"What is Wrong with Perplexity for Long-context Language Modeling?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23771","snapshot_observed_at":"2026-08-07T11:32:31.325398Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:31.325398Z"},"links":{"cited_paper":"/paper/2410.23771","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:a6f4c5e2d8be7e3636fb2fc5b6a93c711e8192cb2b940c8d33d67d64790e6efc","observation_id":"d806dfbb-19a7-441a-be91-e5c89c88849a","resolution":{"observed_at":"2026-08-07T11:32:31.325398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:31.404461Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:31.404461Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:a0c66624a6ff67974c8c3b5787247eaad8dbdbd47c3fcf49c6246a55610e0ef2","observation_id":"26498bb1-f496-4ee5-981c-a2d2327ca820","resolution":{"observed_at":"2026-08-07T11:32:31.404461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12892","last_updated":"2025-05-23T18:07:04Z","snapshot_observed_at":"2026-08-07T18:08:33.531583Z","submitted_at":"2025-02-18T14:29:11Z","title":"Archetypal SAE: Adaptive and Stable Dictionary Learning for Concept Extraction in Large Vision Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12892","snapshot_observed_at":"2026-08-07T11:32:31.498469Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:31.498469Z"},"links":{"cited_paper":"/paper/2502.12892","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:043411f6d95ea87407d1a228c3f7fca787c063b57f32f7d4fd673ba11b5228af","observation_id":"f9e1d120-f8d1-4482-a32e-79b58df81d98","resolution":{"observed_at":"2026-08-07T11:32:31.498469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04093","last_updated":"2024-06-06T14:10:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T14:10:12Z","title":"Scaling and evaluating sparse autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04093","snapshot_observed_at":"2026-08-07T11:32:31.556480Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:31.556480Z"},"links":{"cited_paper":"/paper/2406.04093","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:6fcd5b934fe13047061edae6ed3a0ee86956d990a26873ffb4315301f81fcc1a","observation_id":"6196930f-9655-4357-a026-9770a3a04c75","resolution":{"observed_at":"2026-08-07T11:32:31.556480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:31.651541Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:31.651541Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:bac06ebebba603bc4fb91e09806e26c61f8b5d936e21ad9717d95298b50c701a","observation_id":"c8a86e46-b4af-4838-8164-e2365af67d82","resolution":{"observed_at":"2026-08-07T11:32:31.651541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:31.735392Z","title":null,"venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:31.735392Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:4749d1021190a10060ac3de0bf6ef6a7573ff6d01049c36a6f019c3e23967524","observation_id":"f6a23c9b-4852-4a83-ae16-3458b8fdfe07","resolution":{"observed_at":"2026-08-07T11:32:31.735392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T11:32:31.820709Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:31.820709Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:c28b075d3c805a2ec7cf6b67183a89a1ac4a0ce355be46d850fdd44408484d9f","observation_id":"1ae42265-3bfd-41aa-985f-1fe4ef20f8ce","resolution":{"observed_at":"2026-08-07T11:32:31.820709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02446","last_updated":"2024-07-02T17:22:54Z","snapshot_observed_at":"2026-08-09T02:05:09.965974Z","submitted_at":"2024-07-02T17:22:54Z","title":"Predicting vs. Acting: A Trade-off Between World Modeling & Agent Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02446","snapshot_observed_at":"2026-08-07T11:32:31.856755Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:31.856755Z"},"links":{"cited_paper":"/paper/2407.02446","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:79ee0a16646839f9657857c53409626c9e850e6aed256ad0aa4e1479fa84787b","observation_id":"6a208eac-a134-4e61-a5bc-8d5cfb523b6d","resolution":{"observed_at":"2026-08-07T11:32:31.856755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05147","last_updated":"2024-08-19T07:51:05Z","snapshot_observed_at":"2026-08-04T11:44:14.524984Z","submitted_at":"2024-08-09T16:06:42Z","title":"Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05147","snapshot_observed_at":"2026-08-07T11:32:31.922004Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:31.922004Z"},"links":{"cited_paper":"/paper/2408.05147","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:73564fe54b8267032568127360703a717030f8c5bd0a71b25a34e99cfc9f0492","observation_id":"6190e1b7-d4ce-4800-9123-c51396bdc8d4","resolution":{"observed_at":"2026-08-07T11:32:31.922004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:32.042089Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.042089Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:6663f446a14d5faea9a892bf98ed0375a0f176ff855013d4b00110ddd57f5d2b","observation_id":"98fc0440-1658-44ca-8762-45935ceaeb53","resolution":{"observed_at":"2026-08-07T11:32:32.042089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:32.093503Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.093503Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:302dfea8db0ffe51265cddcd2fb89a18e0cae8d343e6353e6ba7f55d53d480d8","observation_id":"bd29ee27-c979-46cb-8dc3-1a381cc3d306","resolution":{"observed_at":"2026-08-07T11:32:32.093503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:32.177010Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.177010Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:18799ce1cd78cbccb21cbba74199f83af3e5804fcf1a6a5324a04a8a03ec5d9a","observation_id":"750abd68-540b-4a14-ae58-d1f175e64271","resolution":{"observed_at":"2026-08-07T11:32:32.177010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:32.220045Z","title":"Lundberg and Su-In Lee","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.220045Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:8d4228eb627e244f158a9ff32a5172b5bac2363b6eb6964a7d8c929db64ed31f","observation_id":"b198a365-d1f6-4e0e-9268-6049902c26d3","resolution":{"observed_at":"2026-08-07T11:32:32.220045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:34.561486Z","title":null,"venue":null,"work_id":"fd610d61-a015-4c29-9771-e58b55f97777","year":1967},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.290285Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:a6dc8e115752602417895ce46e3fa42d9cb092761780539527367d069d8e1286","observation_id":"fa239c2d-0b86-47f0-b1d6-4e605b1c1684","resolution":{"observed_at":"2026-08-07T11:32:34.603654Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10523","last_updated":"2024-12-07T20:22:22Z","snapshot_observed_at":"2026-08-10T07:55:11.171778Z","submitted_at":"2023-12-16T19:12:45Z","title":"Paloma: A Benchmark for Evaluating Language Model Fit","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10523","snapshot_observed_at":"2026-08-07T11:32:32.328243Z","title":"Jha, Oyvind Tafjord, Dustin Schwenk, Pete Walsh, Yanai Elazar, Kyle Lo, Dirk Groeneveld, Iz Beltagy, Hanna Hajishirzi, Noah A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.328243Z"},"links":{"cited_paper":"/paper/2312.10523","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:71551d1897da8f7c77057733b80ad240596281e15647012ff5c655c83b4e1ec8","observation_id":"b4c218e1-c0d2-44ec-9db0-abb429d0eee4","resolution":{"observed_at":"2026-08-07T11:32:32.328243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5663","last_updated":"2014-03-22T17:12:07Z","snapshot_observed_at":"2026-08-01T16:20:01.675800Z","submitted_at":"2013-12-19T17:46:46Z","title":"k-Sparse Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5663","snapshot_observed_at":"2026-08-07T11:32:32.372507Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.372507Z"},"links":{"cited_paper":"/paper/1312.5663","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:f8afc1d51a2b0b84227aff95c0024e95cfae7aeec3c1f98437062994bb7a274a","observation_id":"9e1387f9-073c-4dbe-99c5-90fb34390349","resolution":{"observed_at":"2026-08-07T11:32:32.372507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:32.456061Z","title":null,"venue":null,"work_id":null,"year":1947},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.456061Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:7838047a6757f0e1d260c35e9c17e65225e761f2f4e58e27528c199b920ec279","observation_id":"22fe38ca-521a-46cb-a6db-f839eb501990","resolution":{"observed_at":"2026-08-07T11:32:32.456061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04382","last_updated":"2025-06-06T18:34:19Z","snapshot_observed_at":"2026-08-09T04:38:43.284518Z","submitted_at":"2025-02-05T18:58:02Z","title":"Sparse Autoencoders for Hypothesis Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04382","snapshot_observed_at":"2026-08-07T11:32:32.518082Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.518082Z"},"links":{"cited_paper":"/paper/2502.04382","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:45a2cf5863bf1f1768e380923ec66e9dc4df70c4a43ad37266b968de3d152122","observation_id":"e22996ef-1270-4ae0-b499-f0af8c9bc356","resolution":{"observed_at":"2026-08-07T11:32:32.518082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-08T06:58:44.493777Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-07T11:32:32.586962Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.586962Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:7984bf3ffa80ae864bce6b0c0d3cf8be728422849d67ca6a9b1f44ea79e69dc0","observation_id":"c7a97efb-ba89-43b4-8c69-c294a59ce2a4","resolution":{"observed_at":"2026-08-07T11:32:32.586962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:32.697869Z","title":"why should i trust you?","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.697869Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:6df0e68509486285aad8dc7d7dfed77c19f1c4091a97bce22871baab7c84ad48","observation_id":"e03158a7-45b2-4d6a-ad1b-3507f75dfb40","resolution":{"observed_at":"2026-08-07T11:32:32.697869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:32.773068Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.773068Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:592d6a3e566c94a7903c85ed8dab6ff48a33df79ba8e0091a009be4a13ef4864","observation_id":"9295b773-42d0-48fa-b5a9-a1ee5ab6dd1b","resolution":{"observed_at":"2026-08-07T11:32:32.773068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:34.403728Z","title":null,"venue":null,"work_id":"34ddd604-a496-4daf-bbe5-c7845d9a7581","year":2023},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.849107Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:b6a985470cb63010eeff7b88bdccf4e3c0c5d70510b25e6300235720941adccd","observation_id":"ac1fba95-4f9c-4244-b2a3-b67759ad9fd6","resolution":{"observed_at":"2026-08-07T11:32:34.464013Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:34.230452Z","title":null,"venue":null,"work_id":"e0a31916-801d-44ef-a3ce-704500b4a8a6","year":2020},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.894663Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:db5daad9544246cb909e3463cba758a69dd1aef7521614ed09d6a5d4a3c8a616","observation_id":"91270226-2f16-490a-b4f7-755027990324","resolution":{"observed_at":"2026-08-07T11:32:34.341292Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00159","last_updated":"2024-06-06T18:46:40Z","snapshot_observed_at":"2026-08-08T04:07:59.311599Z","submitted_at":"2024-01-31T20:29:50Z","title":"Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00159","snapshot_observed_at":"2026-08-07T11:32:32.979857Z","title":"Peters, Abhilasha Ravichander, Kyle Richardson, Zejiang Shen, Emma Strubell, Nishant Subramani, Oyvind Tafjord, Pete Walsh, Luke Zettlemoyer, Noah A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.979857Z"},"links":{"cited_paper":"/paper/2402.00159","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:3089a9193abaf6a43acf389769164d28ddf9a88576657d8c0eac57d4cbbdfd7c","observation_id":"89ed208d-bbd8-4b75-9185-b47e5c119f9b","resolution":{"observed_at":"2026-08-07T11:32:32.979857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T11:32:33.048665Z","title":"Stone, Peter Albert, Amjad Almahairi, Yasmine Babaei, Nikolay Bashlykov, Soumya Batra, Prajjwal Bhargava, Shruti Bhosale, Daniel M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:33.048665Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:d977f386d9f560703678a645b3cfce4361e7a68ac53957e88a107f3a2e2cb568","observation_id":"05657507-bd86-4d91-b910-a2ef2ca5cdfe","resolution":{"observed_at":"2026-08-07T11:32:33.048665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:33.107245Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:33.107245Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:b362aa7be66085ad11db9beb4ed82b82c11f5a7d9bda4adc6caa17c33ebdaded","observation_id":"69591c4d-718a-48fb-8ae1-0dbb3a51e0d2","resolution":{"observed_at":"2026-08-07T11:32:33.107245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:33.232385Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:33.232385Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:0626a887481a29e21e7fe55557f74467276c876e9373a84fdbc47fc0002bb4f6","observation_id":"a11d6189-b3e3-425a-a0a6-163d507857ca","resolution":{"observed_at":"2026-08-07T11:32:33.232385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:33.439872Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:33.439872Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:6e04476b5179c77465ed1fa32ef3d0b411d4f7babaf905490c23217c26d75a12","observation_id":"fce78916-08af-43fc-aed4-34a5549a9bb4","resolution":{"observed_at":"2026-08-07T11:32:33.439872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:33.493899Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:33.493899Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:ea197fbd1f79b0c5c14c615d6a96a6775fd477cb9aa373718c78375a0f9e14fb","observation_id":"e704057e-cc5c-4f8d-b668-4e84aac29bd9","resolution":{"observed_at":"2026-08-07T11:32:33.493899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T08:54:59.875781Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2506.02204."}