{"as_of":"2026-08-11T01:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cf4247f5b1da37429d78c04e42dc8233c9474ec820eb48b8df4cfb0547ee575c","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:36:27.623294Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T10:52:00.147391Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T08:17:45.480579Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"cited_work":{"arxiv_id":"2507.02378","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02378","snapshot_observed_at":"2026-07-03T08:17:45.480579Z","title":"Jinlong Pang, Na Di, Zhaowei Zhu, Jiaheng Wei, Hao Cheng, Chen Qian, and Yang Liu","venue":null,"work_id":"e6d0997b-daa3-45e1-be2a-8e0582c02ca5","year":null},"citing_paper":{"arxiv_id":"2606.18286","last_updated":"2026-06-10T04:46:04Z","snapshot_observed_at":"2026-08-07T16:29:18.257991Z","submitted_at":"2026-06-10T04:46:04Z","title":"CODEBLOCK: Learning to Supervise Code at the Right Granularity","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T10:52:00.147391Z"},"links":{"cited_paper":"/paper/2507.02378","citing_paper":"/paper/2606.18286"},"observation_digest":"sha256:ad98c92e720130acfbfdc3310839e4c50c947c042d4a99f622fb3912ce9678cd","observation_id":"dfdfb155-8e6d-4a70-b969-dda33eb07b5b","resolution":{"observed_at":"2026-07-03T08:17:45.481981Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02378/citation-record","integrity":"/paper/2507.02378/integrity","json":"/paper/2507.02378/citation-record.json","paper":"/paper/2507.02378"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:24.253041Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:24.253041Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:32282f6b07c9135ed679d51f305af3817d40f279dec7259c52fdd405abea5b73","observation_id":"6d47b29a-9b9a-41f5-910e-279a2f068392","resolution":{"observed_at":"2026-08-06T20:36:24.253041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:24.315891Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:24.315891Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:4e7a4e4645e5eccc60d27348623740dcf29f0167a7e88476eb8f1fca90459ce4","observation_id":"1530e288-60d8-4255-b14a-d55cd74c5e23","resolution":{"observed_at":"2026-08-06T20:36:24.315891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T20:36:24.385469Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:24.385469Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:3749e536985ffa8cf2d9d2427f9325ce48b04cbe8e50255717b569dca6df7629","observation_id":"184366e2-500e-4eb1-829d-34db6326aaff","resolution":{"observed_at":"2026-08-06T20:36:24.385469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20541","last_updated":"2024-05-30T23:50:20Z","snapshot_observed_at":"2026-08-10T10:55:20.865091Z","submitted_at":"2024-05-30T23:50:20Z","title":"Perplexed by Perplexity: Perplexity-Based Data Pruning With Small Reference Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20541","snapshot_observed_at":"2026-08-06T20:36:24.475089Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:24.475089Z"},"links":{"cited_paper":"/paper/2405.20541","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:f2c6b1ef124e4efe24070acfe98770aec65ad131e6f0151f2f7488b3a229c4cf","observation_id":"97b83b19-cb3b-48da-8586-428245df9003","resolution":{"observed_at":"2026-08-06T20:36:24.475089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-06T20:36:24.565907Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:24.565907Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:8f0bc6303afe7a8f55ffe1d77b598b6ad2a63a7f59c50254d47d3cbc755f98cc","observation_id":"06a0b538-49bc-42fa-b0e2-0f6f3e6d3e03","resolution":{"observed_at":"2026-08-06T20:36:24.565907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:24.639554Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:24.639554Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:f05506fb51212b2794d9d22720eccd6e39ddf14db8724296a8be026d14f5d5da","observation_id":"17f165ad-e20b-461a-b16c-eb7e2d169c71","resolution":{"observed_at":"2026-08-06T20:36:24.639554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:24.757317Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:24.757317Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:504c25bad2220360e696b71e35ebdd10af8e3d90a7c627ba0190826c48070d94","observation_id":"5206f39d-1226-4e27-91e2-88f56bd5d02b","resolution":{"observed_at":"2026-08-06T20:36:24.757317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-06T20:36:24.858894Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:24.858894Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:2a4289f856d7470aaaae94f1afe5eac5b527cb1f0f2c3b0d11666a8b02f56e57","observation_id":"d5a037d0-b2aa-4f90-8884-0236feaab071","resolution":{"observed_at":"2026-08-06T20:36:24.858894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:24.909502Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:24.909502Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:c8fde212b5503830d8f6b55acaf5d7201cf2f79beb38ba5ccecf44ca52396015","observation_id":"58cf13e3-02ce-4d70-bdec-2d458a6950fc","resolution":{"observed_at":"2026-08-06T20:36:24.909502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-08-10T21:55:43.802039Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-06T20:36:25.001113Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:25.001113Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:12bf1522af694fcf1496524b67bb0cac95cb0f3057713a88920b974f1fe31c98","observation_id":"410c93b6-55da-45c7-a6da-b73a48f59ae6","resolution":{"observed_at":"2026-08-06T20:36:25.001113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T20:36:25.065178Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:25.065178Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:cf198acd4bd0bc52c340036e6937bdcead941298035ce8a836e79b7763769b86","observation_id":"2775ced7-4522-49e0-9601-6156dd447c01","resolution":{"observed_at":"2026-08-06T20:36:25.065178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-06T20:36:25.139734Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:25.139734Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:b06c2785611a0ca2a53041a475598d5076b378849431bd1e1d3a00b3cb112f23","observation_id":"61bb56d8-59dc-4dcd-b2b5-16f194ce122f","resolution":{"observed_at":"2026-08-06T20:36:25.139734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-06T20:36:25.257707Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:25.257707Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:c87de3b7f804c48575b0b59fa6a556f9c59d444746a42f384dc87634a2156dc7","observation_id":"074653b1-5ee5-434c-8111-5f36ba27708f","resolution":{"observed_at":"2026-08-06T20:36:25.257707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T20:36:25.361808Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:25.361808Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:e56c3d18bd82aa886fda4cb93d190eae287ce784e51447ce5ce407631d029532","observation_id":"f9330d3e-ff09-4296-bdaa-40f1d793c0a2","resolution":{"observed_at":"2026-08-06T20:36:25.361808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:25.452332Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:25.452332Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:b191892be31a29e720b9e01f95ef3a6d10cb8b9850ee387c9a76ae843cdca1f8","observation_id":"eba46643-adc0-44cd-b9c7-03c3c742eb8a","resolution":{"observed_at":"2026-08-06T20:36:25.452332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:30.498414Z","title":null,"venue":null,"work_id":"0dfdbe84-6b16-4b1f-8e2f-190221c7b4a1","year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:25.568234Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:57d8f1d849a7f72f0a12c28969f2728b2117a7203a570cd21027d895bb3d289c","observation_id":"b33492bc-7508-48ed-b99d-733f56407e78","resolution":{"observed_at":"2026-08-06T20:36:30.640440Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:30.180865Z","title":null,"venue":null,"work_id":"719b1fb2-70fd-463a-9910-251e37306eb5","year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:25.672751Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:49ad5fed7f70528f68afe61278db299de6f8d18f732918068f1b88f2b8346ed8","observation_id":"b7e9c6df-9206-4ed7-a26f-06d81a4e8be0","resolution":{"observed_at":"2026-08-06T20:36:30.337089Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:25.756846Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:25.756846Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:dbe21e6484c24f8a4707c440fbded9c21a3d78658aba836af28e764824aa7a6a","observation_id":"e633a204-1831-4da0-baf4-d9da1cf7c6fa","resolution":{"observed_at":"2026-08-06T20:36:25.756846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06161","last_updated":"2023-12-13T14:44:10Z","snapshot_observed_at":"2026-07-06T15:25:35.930688Z","submitted_at":"2023-05-09T08:16:42Z","title":"StarCoder: may the source be with you!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06161","snapshot_observed_at":"2026-08-06T20:36:25.865573Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:25.865573Z"},"links":{"cited_paper":"/paper/2305.06161","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:34cde440be6f75ec802ab10920cf1e741b887e38755397250b0aab5809368532","observation_id":"4901747e-c2e9-4f05-8354-9e59b3ed2c33","resolution":{"observed_at":"2026-08-06T20:36:25.865573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T20:36:25.952352Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:25.952352Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:4185cc66efbdbf1a6ec8e155acc22113b6770783481a4fb7aefca6ffe18694bf","observation_id":"c0062fbd-1fd2-4397-a04a-aa7677df6893","resolution":{"observed_at":"2026-08-06T20:36:25.952352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:26.051015Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:26.051015Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:20f0589da6b2467afcd8002d1f8dd1c2fd67f376d7fbe1ffe32f42f181fee9cd","observation_id":"121d2710-c310-4b59-8e6d-41b8da29dc1a","resolution":{"observed_at":"2026-08-06T20:36:26.051015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:26.149468Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:26.149468Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:71060271520c6cecf0005beceb9e78ce89996e790bb13b48f0602d9ddc79e699","observation_id":"e18534e1-1e3b-49fa-b357-153a87a2e91c","resolution":{"observed_at":"2026-08-06T20:36:26.149468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19173","last_updated":"2024-02-29T13:53:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T13:53:35Z","title":"StarCoder 2 and The Stack v2: The Next Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19173","snapshot_observed_at":"2026-08-06T20:36:26.249299Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:26.249299Z"},"links":{"cited_paper":"/paper/2402.19173","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:5987a3f168feb3382a2a67fbc137b540bde9d59b71a7df78a2080f88428227bd","observation_id":"7254fcc8-4a3e-4ff2-9549-c47b5b650947","resolution":{"observed_at":"2026-08-06T20:36:26.249299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:29.812975Z","title":null,"venue":null,"work_id":"555339b6-d53d-48a8-a328-df1f4d39e8a1","year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:26.344064Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:cb1c94e47cc895c0711e03e3e6dcfb60f8e7887c7e559e69273fddc783bf4fd0","observation_id":"dcb386fa-77db-4912-8493-1d401c48dd12","resolution":{"observed_at":"2026-08-06T20:36:29.952328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:29.499055Z","title":null,"venue":null,"work_id":"0e1b6f48-206e-4793-817f-03d466f3d264","year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:26.411577Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:8935891a0b278a283477353968db29fab704f4f4ff81a03e51d205cff54bfd9d","observation_id":"0814fd87-6cf6-40ce-bd1d-ad7a42a5d17e","resolution":{"observed_at":"2026-08-06T20:36:29.647463Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12687","last_updated":"2025-04-17T06:29:28Z","snapshot_observed_at":"2026-08-07T16:01:35.237595Z","submitted_at":"2025-04-17T06:29:28Z","title":"Data-efficient LLM Fine-tuning for Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12687","snapshot_observed_at":"2026-08-06T20:36:26.513190Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:26.513190Z"},"links":{"cited_paper":"/paper/2504.12687","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:efb5748b565aed2dd058a5bada4e13aa3ae518c9eb20604103f55289994a6ad8","observation_id":"edcf25bf-0b2b-4cbd-88ff-bf72955a8efc","resolution":{"observed_at":"2026-08-06T20:36:26.513190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-06T20:36:26.625005Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:26.625005Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:5ea1778e0e1f9acee45898d0ecc629336674b376d0a4ea720fa840d1e72f6c75","observation_id":"23ec378a-0a40-4984-8459-d63990473352","resolution":{"observed_at":"2026-08-06T20:36:26.625005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-06T20:36:26.692660Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:26.692660Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:84d0e2909bc710f69735f39a8b967e1a4cbfd7dcf8052530cc9989a424972c8c","observation_id":"4e2f2ddd-5b2f-40c3-bba2-2372b1e9c139","resolution":{"observed_at":"2026-08-06T20:36:26.692660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:26.766654Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:26.766654Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:1b727e5fc612e743f8ecffba34be626d16c8c9e7e4270a0f1150ddcb9668f536","observation_id":"60544639-b05d-4afe-8249-e27f792a11b6","resolution":{"observed_at":"2026-08-06T20:36:26.766654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11409","last_updated":"2024-06-19T02:37:50Z","snapshot_observed_at":"2026-08-09T12:24:34.299363Z","submitted_at":"2024-06-17T10:54:35Z","title":"CodeGemma: Open Code Models Based on Gemma","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11409","snapshot_observed_at":"2026-08-06T20:36:26.843248Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:26.843248Z"},"links":{"cited_paper":"/paper/2406.11409","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:a692af4a34d0bb38acb4fea2062ddc3070b7683ada7cc057dbee0f725b787892","observation_id":"154080a7-acd9-49f1-baa0-6570049a1479","resolution":{"observed_at":"2026-08-06T20:36:26.843248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T20:36:26.913868Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:26.913868Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:6ee18e3629203f74ccdfc61d73c3fb6d1070837aa88feb87fafdd1df36b2bd69","observation_id":"18994a18-11ad-47d8-9c94-d20163ad132f","resolution":{"observed_at":"2026-08-06T20:36:26.913868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:29.182215Z","title":null,"venue":null,"work_id":"e7db32ac-6cd0-49df-b1fe-eed9d3f94184","year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:27.026596Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:795f4a26d47aac3eadccc46622342282062a46bed824180b5c47d5f025c97c76","observation_id":"08116d72-2f7a-44d8-8c6a-01676b65af29","resolution":{"observed_at":"2026-08-06T20:36:29.290418Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:29.004119Z","title":null,"venue":null,"work_id":"96849642-f79b-49eb-94ce-13f87d68c4f0","year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:27.097866Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:263b2263e51f3b6806418dfc80166bdba2c2c03c06b7961a76e1b28f01380751","observation_id":"5ac8c9c6-b6fc-4b66-a96a-8dbf42a016ee","resolution":{"observed_at":"2026-08-06T20:36:29.093657Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-08-10T07:52:08.606999Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-06T20:36:27.155039Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:27.155039Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:4db7267605dbc8781af8994d3d9d0346f6d056db641c96533ae22723a1de0c0c","observation_id":"fb9c526a-e209-46d6-9051-08580a693727","resolution":{"observed_at":"2026-08-06T20:36:27.155039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:28.766597Z","title":null,"venue":null,"work_id":"5d95c0a2-4cb2-418d-9fbb-093b72b6377d","year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:27.201596Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:d13ae94a15d8e50147e3dc5e9208f99b0d88d34842e90470b26a1f078015c0fe","observation_id":"ad6a95e2-2899-4ca1-9d59-51db2d4e0f1f","resolution":{"observed_at":"2026-08-06T20:36:28.895363Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:28.545859Z","title":null,"venue":null,"work_id":"3acf1c3b-4a80-4382-b6c6-66af65785ed8","year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:27.248882Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:ca8c7cafff69fea735028d5951486656aa142ccbd0eaa3ae9c76d3d62e72ec66","observation_id":"53962ff8-a31b-423e-b7c2-57eebad9ac1d","resolution":{"observed_at":"2026-08-06T20:36:28.613930Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:28.497482Z","title":null,"venue":null,"work_id":"1fb046f7-945f-42f9-b7e7-0201067e7f13","year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:27.303897Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:c08a71b862e5ccb5c66757a8f25c3395ab5aa4307d3788b125910a74cc7fe9c4","observation_id":"646e207f-db94-4995-889a-2860491650b4","resolution":{"observed_at":"2026-08-06T20:36:28.534842Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:28.355554Z","title":null,"venue":null,"work_id":"5ab877b4-b2bb-4e4f-be80-7bd0fcf2b0c2","year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:27.372864Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:4d2f4b8786a16776af9e8a23c4d067865044a19670e9e238e69d88f05bf246f1","observation_id":"94992be1-19b6-49e6-90a4-03309f9b5532","resolution":{"observed_at":"2026-08-06T20:36:28.411944Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11508","last_updated":"2023-12-27T08:23:14Z","snapshot_observed_at":"2026-08-02T00:30:18.538738Z","submitted_at":"2023-12-12T03:30:21Z","title":"Rethinking the Instruction Quality: LIFT is What You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11508","snapshot_observed_at":"2026-08-06T20:36:27.423317Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:27.423317Z"},"links":{"cited_paper":"/paper/2312.11508","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:53fa4e37cd4b78ae3616a03015624c3d70d1610f46b4ac19c79c8389e00a1b6d","observation_id":"464d79b7-0392-4fc9-a5be-e98f6bd022f6","resolution":{"observed_at":"2026-08-06T20:36:27.423317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T20:36:27.475388Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:27.475388Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:005f5f796dc2fe98defabbd42d9ecb6a379633564f118c542541762b6fc09e8b","observation_id":"b4e27a98-c314-4bf5-b2f8-d94d19ece65f","resolution":{"observed_at":"2026-08-06T20:36:27.475388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:28.223914Z","title":null,"venue":null,"work_id":"531c1fe2-1b83-4b49-93fd-628ec5561606","year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:27.521402Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:06c954568c805ea40d12d3c404621a5d356507dd902221f22b7040eb11407885","observation_id":"21fa1f1f-2a6b-4ee9-aeb2-ec6e6afc2462","resolution":{"observed_at":"2026-08-06T20:36:28.281943Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:28.122111Z","title":null,"venue":null,"work_id":"f61bd615-a6b4-4ad2-8822-7f6af2c85fd6","year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:27.573070Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:cd4936ce3f1c6c8412f3f5e2111c6f32169805f8b4b87001113689ae830c01b8","observation_id":"76e13e76-4906-4386-9b92-b60af2da2f59","resolution":{"observed_at":"2026-08-06T20:36:28.162023Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:28.009022Z","title":null,"venue":null,"work_id":"6b6009f3-2b37-4cc1-aff9-b5386b91abf2","year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:27.623294Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:5478a4b28ee3f13bb91ede45b04811bc82c2267578168adbc992ebb8b1294fef","observation_id":"0cc06e8f-23f6-40c0-8a4c-d6f586b7d126","resolution":{"observed_at":"2026-08-06T20:36:28.063939Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T11:58:38.490692Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2507.02378."}