{"as_of":"2026-08-10T00:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bb3023b125a7af23fdf9981ee47708a2553e5ef485fa731a2e7e2e191cd2af9e","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T21:20:29.888987Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16122/citation-record","integrity":"/paper/2607.16122/integrity","json":"/paper/2607.16122/citation-record.json","paper":"/paper/2607.16122"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:25.052530Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:25.052530Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:a3ea01788a09167fca910156751249d716fcd9c84dd52aaff2a464139c2f3381","observation_id":"eeaafd01-b6d5-4b49-8ec3-95f5709c72f3","resolution":{"observed_at":"2026-08-01T21:20:25.052530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08775","last_updated":"2025-05-13T17:53:59Z","snapshot_observed_at":"2026-07-06T21:23:23.760393Z","submitted_at":"2025-05-13T17:53:59Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08775","snapshot_observed_at":"2026-08-01T21:20:25.119254Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:25.119254Z"},"links":{"cited_paper":"/paper/2505.08775","citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:c89f3649a8ff266240585c7c3d2523b0d8865425a76d0f8a5e87d780848746d4","observation_id":"eed199f4-f09b-4a45-8de0-21fb09b2ccfc","resolution":{"observed_at":"2026-08-01T21:20:25.119254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:25.196490Z","title":"Chen, Y.-M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:25.196490Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:5f570be3ff2e55266643ed69c8b28bb66366708db0c8e0501c2253187324e021","observation_id":"40aa89b9-cbb8-4809-bbe1-5eb40271648f","resolution":{"observed_at":"2026-08-01T21:20:25.196490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:25.267860Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:25.267860Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:fe2e90ac64623bd4b4337a16267d4dde909cef8ed2ddf33a58223ee317c7e887","observation_id":"61eb5214-4c6c-46bf-865c-77e0460f76e2","resolution":{"observed_at":"2026-08-01T21:20:25.267860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:25.333464Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:25.333464Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:a1b157660fa193e9d9f89d64e646b2d72921d870dc1d318ec760db5dbc8348db","observation_id":"2afc72e5-0d8c-4d50-b5bd-fc132986bff7","resolution":{"observed_at":"2026-08-01T21:20:25.333464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-01T21:20:25.396821Z","title":"Comanici, E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:25.396821Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:3bcd5c4d336eabd2cc4828924d04b5a0df9579e088eef7ab7bf731321665527d","observation_id":"a34144c5-2c9f-4d94-96ad-80d1763c41c8","resolution":{"observed_at":"2026-08-01T21:20:25.396821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:25.401732Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:25.401732Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:84732e5bc6299a506b1c4bab4109fed9c3b2d37241ded17c1f577aa6a1666472","observation_id":"5a820982-a194-4aa2-ab4d-b878d1d129f2","resolution":{"observed_at":"2026-08-01T21:20:25.401732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04945","last_updated":"2025-04-07T11:31:22Z","snapshot_observed_at":"2026-08-07T16:08:01.274380Z","submitted_at":"2025-04-07T11:31:22Z","title":"A Llama walks into the 'Bar': Efficient Supervised Fine-Tuning for Legal Reasoning in the Multi-state Bar Exam","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04945","snapshot_observed_at":"2026-08-01T21:20:25.428186Z","title":"Fernandes, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:25.428186Z"},"links":{"cited_paper":"/paper/2504.04945","citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:1d8aa1e55af45ab4acec60344adb336a39b3ba53cd6ab0837821426c6e69a3d3","observation_id":"b71bc2f3-9761-4111-b498-3b6d2e53c3f0","resolution":{"observed_at":"2026-08-01T21:20:25.428186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-01T21:20:25.562711Z","title":"Grattafiori, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:25.562711Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:57b917e85b1a8aaae5b8bb0d520b0c2b47f38dafc361dd70f2fcc6a8ad184482","observation_id":"4a4ea224-9747-48ce-821d-0b235c77735d","resolution":{"observed_at":"2026-08-01T21:20:25.562711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:25.664394Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:25.664394Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:482c34e3815d6092dc3c7479150d14aa80984fb79283e376e4e7e7f2c81febdd","observation_id":"48a93664-a043-4401-ab41-1a59452092af","resolution":{"observed_at":"2026-08-01T21:20:25.664394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17746","snapshot_observed_at":"2026-08-01T21:20:25.802827Z","title":"Gunjal, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:25.802827Z"},"links":{"cited_paper":"/paper/2507.17746","citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:d77708a35558c94d94501371f45784e09a17602d8ea60ede212122177ca30082","observation_id":"2d35437a-b517-422f-b63b-23d67285a79e","resolution":{"observed_at":"2026-08-01T21:20:25.802827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:26.062140Z","title":"Hendrycks, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:26.062140Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:6fdd174e775db4945ea2cdfd39e58a849a5313ee0ae64daf7c75d77593b41297","observation_id":"3587a60d-7312-4fab-b4e1-8ff2bf7e1584","resolution":{"observed_at":"2026-08-01T21:20:26.062140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:26.314765Z","title":"Holzenberger, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:26.314765Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:f0c1b4fef896b3f726e99a24db3daa6a2259fcb46d5dffceed0d2fe420712690","observation_id":"7bb55530-7e39-445e-92ef-c8e2f36f37f3","resolution":{"observed_at":"2026-08-01T21:20:26.314765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:26.195798Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:26.195798Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:8bde3f7f04617127a845c49510ff85d7f1cd10749801a57650ada96bd2bae2b8","observation_id":"6a359814-8b44-40fa-af33-8e599bf1e5a2","resolution":{"observed_at":"2026-08-01T21:20:26.195798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-01T21:20:26.494751Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:26.494751Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:7cc6fc55afe5db18dddbbd2c48124d2fdb9e220fc8816488a49639e2035f4ac3","observation_id":"9db14fd9-c1e3-4899-87c6-d5dc8686203f","resolution":{"observed_at":"2026-08-01T21:20:26.494751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:26.392634Z","title":"Islam, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:26.392634Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:6afa296a12ba6006d1516ce4cb7c97b141cdf223053f0dfcccb243cc76103562","observation_id":"8818786e-511a-4ed8-95da-ae1a44bc8cb4","resolution":{"observed_at":"2026-08-01T21:20:26.392634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:26.727937Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:26.727937Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:ac11870aba7feb6b1f734d65c4e050e2a5117669a5c88658b1c4e03a7b0fde2f","observation_id":"090bf821-e32f-4853-b812-dd741b1de6a5","resolution":{"observed_at":"2026-08-01T21:20:26.727937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:26.604759Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:26.604759Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:b573c6db76be7ba7c51fd368e548c4cef09f0e72cb47be823d697e8b24a35231","observation_id":"ca511cdb-a9b1-4462-9c87-b169a4e16778","resolution":{"observed_at":"2026-08-01T21:20:26.604759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:27.026968Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:27.026968Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:e3a18b57ae9a670d6f386c8fbd879009ee178510d91ba981e1f3bb865cc2707e","observation_id":"34c2a0a1-d160-4f96-95da-73137bf14510","resolution":{"observed_at":"2026-08-01T21:20:27.026968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:26.825972Z","title":"Koreeda and C","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:26.825972Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:5af472ff5b25ec8257bc11cfcbde45933de3f4ba1e4b61a19d610853e7b0f9d2","observation_id":"c948e65b-be5b-4c02-b8f0-728faa2a9548","resolution":{"observed_at":"2026-08-01T21:20:26.825972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:26.905563Z","title":"doi: 10.18653/v1/2021.findings-emnlp.164","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:26.905563Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:b069597054837001874c2aec490ced0893a8570d7812d451d04c3a1f1bd887fe","observation_id":"58473149-d5a4-4b34-8a6a-b71f8165db69","resolution":{"observed_at":"2026-08-01T21:20:26.905563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12474","last_updated":"2026-05-12T17:54:25Z","snapshot_observed_at":"2026-08-03T08:00:52.890954Z","submitted_at":"2026-05-12T17:54:25Z","title":"Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12474","snapshot_observed_at":"2026-08-01T21:20:27.402253Z","title":"Mahmoud, M","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:27.402253Z"},"links":{"cited_paper":"/paper/2605.12474","citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:d7890536c19796ce38302aaceba40ff7b43ce18c1dbd8c72207b988644f63377","observation_id":"84f5df99-0376-44ec-875a-8bc0944af66e","resolution":{"observed_at":"2026-08-01T21:20:27.402253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:27.147438Z","title":"Liang, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:27.147438Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:2c23c327b73c5e91da7740648efc333601e6c08195a1db69dcda271598cb0a68","observation_id":"ca2f5c48-46ee-4c24-a23d-96cb0662fade","resolution":{"observed_at":"2026-08-01T21:20:27.147438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:27.243513Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:27.243513Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:07a60fcb637f7713506618cdcf8f1eab71292f9407bf9abc1b48a871542c7b3e","observation_id":"1b121e1d-0498-4214-a49e-20ac5e497060","resolution":{"observed_at":"2026-08-01T21:20:27.243513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:27.647467Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:27.647467Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:a2486bc0e78981e5645dbe7030eeddc7eb5d5661c6c974574da8ac9467f08a19","observation_id":"27025dbf-4308-4170-81db-0f7f4b548a4f","resolution":{"observed_at":"2026-08-01T21:20:27.647467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:27.876935Z","title":"Rezaei, R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:27.876935Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:f26bbca3dde4b495497bc2dd92c81135516e1bbb3d94f83aa916b1c96efba21e","observation_id":"b80988d9-40ed-4407-ab43-ee31576548d9","resolution":{"observed_at":"2026-08-01T21:20:27.876935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:27.464754Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:27.464754Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:f67656b9af55b97d79194276feb0decc243fb0316233e664166d1bb15df20441","observation_id":"5eb7f174-fec1-4ca5-99d0-d36c09ec91f4","resolution":{"observed_at":"2026-08-01T21:20:27.464754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:27.552725Z","title":"text-embedding-3-small","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:27.552725Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:08c49f3a99c0f4aa32ad9d496cab2163be6ff7cd561a6456af73277a70399b94","observation_id":"81ded3b6-25e7-4662-a9d7-7a65e7ae28b2","resolution":{"observed_at":"2026-08-01T21:20:27.552725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:28.143621Z","title":"Srivastava, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:28.143621Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:7c844697ca922892866a13c0a69a7c6d6b31ae986edca76d22ab30902ab6d5df","observation_id":"c62708b8-836c-446d-855e-acfa4b610128","resolution":{"observed_at":"2026-08-01T21:20:28.143621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13678","last_updated":"2024-12-18T10:05:43Z","snapshot_observed_at":"2026-08-08T02:37:51.971374Z","submitted_at":"2024-12-18T10:05:43Z","title":"Clio: Privacy-Preserving Insights into Real-World AI Use","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13678","snapshot_observed_at":"2026-08-01T21:20:28.224786Z","title":"Tamkin, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:28.224786Z"},"links":{"cited_paper":"/paper/2412.13678","citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:00a45c22b98a6ad2280a93be2f8adac5b53eaf2d145f8fc092c9267c324db34d","observation_id":"c72657d9-80a2-48a7-87e5-747387d8ea52","resolution":{"observed_at":"2026-08-01T21:20:28.224786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:28.338541Z","title":"Viswanathan, Y","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:28.338541Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:baf034318ba79d17faf1d6fa9be85065a992ca4d7ab09675d5c825e458babbfe","observation_id":"caed2041-e90a-4d34-9421-5c670e72ce89","resolution":{"observed_at":"2026-08-01T21:20:28.338541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:27.962571Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:27.962571Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:37a24a37b39d7ed245fa809a702d65d08f6f85d41d0cc688ba48f77942e83df9","observation_id":"c5f3fa74-8215-4349-8244-bf0b5f3e5811","resolution":{"observed_at":"2026-08-01T21:20:27.962571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:28.071115Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:28.071115Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:78feb3de517abcaa0b0ec7b9b7ab449c9bdcb2900c51ac9422d8663adcdf383f","observation_id":"55539be8-4d65-4147-9f97-0e3ccb9f4372","resolution":{"observed_at":"2026-08-01T21:20:28.071115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T21:20:28.852288Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:28.852288Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:bfba17eccfd2ae125e4fc849d8b20e9722823899acad530a6b8dfbc254d69ca5","observation_id":"d69c5ac4-3481-4262-85fd-74251d099c87","resolution":{"observed_at":"2026-08-01T21:20:28.852288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:29.015248Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:29.015248Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:b0e95256f51c536716bf2573e6a88e2233f1c27bb7965e7632d54c1d3d8d5045","observation_id":"e754a5b8-829d-4da5-b873-0117f110f480","resolution":{"observed_at":"2026-08-01T21:20:29.015248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:29.123126Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:29.123126Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:98e385c001d6a6e34bf137e380b7b785ed090656ca11efaea560735326b915c2","observation_id":"99fd1b76-a5ae-4e44-8a79-b848f5e62b43","resolution":{"observed_at":"2026-08-01T21:20:29.123126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:28.550321Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:28.550321Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:443e8c5dfdc9e9324ebabee1e55268913c64d4e9024a8a106da1ced93bf6917e","observation_id":"89b5912d-f953-4fbb-8bea-0939b24c5eac","resolution":{"observed_at":"2026-08-01T21:20:28.550321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:28.690135Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:28.690135Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:03162ef436d30468efa790889ab2690062125561db35f4ba03552e6c989d930b","observation_id":"9e7cb0b3-109e-45d8-858c-d02a5a089925","resolution":{"observed_at":"2026-08-01T21:20:28.690135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:29.652546Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:29.652546Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:3805f539488402145e33da01dfa16455cdce3dd394df63ae84d8cdb83f71b113","observation_id":"1932aacf-d6e6-4dac-8e27-3fc47ae0a690","resolution":{"observed_at":"2026-08-01T21:20:29.652546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:29.766316Z","title":"Zheng, N","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:29.766316Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:78c768088d2f61646b787cf995e9f413b4e55bce382b5d4dd21204ecf03d7a23","observation_id":"562dde5f-5b65-42cd-a41d-beea6cfef163","resolution":{"observed_at":"2026-08-01T21:20:29.766316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:29.888987Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:29.888987Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:694980a36094a9ea45adbe301877a1675d48476044df7d9a84ba7ae7fa8c156c","observation_id":"31f7c4a8-87fe-44ae-946e-00d26018c848","resolution":{"observed_at":"2026-08-01T21:20:29.888987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:29.325864Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:29.325864Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:61aa434ac744c5793f3755efc1cbf6c24069edc24d1677f9cad644bad1fddeca","observation_id":"d6c52398-f9df-42b3-bb89-3e238d07da79","resolution":{"observed_at":"2026-08-01T21:20:29.325864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:29.456855Z","title":"Zhang, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:29.456855Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:9af2596e49095685a106f3aff57d7b55b95dd8930f3f372c84d888e8fd693ef6","observation_id":"1be8a02b-0dcb-407e-b69a-3b2bd7c7f835","resolution":{"observed_at":"2026-08-01T21:20:29.456855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:27.315555Z","title":"doi: 10.18653/v1/2023.emnlp-main.153","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:27.315555Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:d2ae1e04d5c4e4d0213fb74ea99f0085f44277e1e5120d5598a206e38596eb14","observation_id":"bb378d81-5398-49f5-8d62-89538eadc7e0","resolution":{"observed_at":"2026-08-01T21:20:27.315555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:27.751974Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:27.751974Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:c7dbccbe5989e0d4cf1cc24f2a32949c812f736304c5c533814b8011eb83e709","observation_id":"c66014a0-0125-40be-9749-fc12a664ae87","resolution":{"observed_at":"2026-08-01T21:20:27.751974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T13:31:45.505069Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2607.16122."}