{"as_of":"2026-08-19T14:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:838c92a5c655a4aad719dcc8c844b6f2429cd2b698a25e541417d652e9995576","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T09:17:18.180681Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:26:52.616368Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-14T04:26:52.804893Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"cited_work":{"arxiv_id":"2607.19376","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.19376","snapshot_observed_at":"2026-08-14T04:26:52.804893Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","venue":"q-bio.QM","work_id":"677042bb-faf5-4ac1-aa4a-39eed8c40416","year":2026},"citing_paper":{"arxiv_id":"2608.08892","last_updated":"2026-08-09T20:13:17Z","snapshot_observed_at":"2026-08-18T23:37:41.555140Z","submitted_at":"2026-08-09T20:13:17Z","title":"A Symmetric Layer-Union Audit of Component Collapse in Hierarchical Procedural Corpora","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:26:52.616368Z"},"links":{"cited_paper":"/paper/2607.19376","citing_paper":"/paper/2608.08892"},"observation_digest":"sha256:5b98c23ae8528f109c8ae415d3f1de80e06b96fa9e156331a461c4246e5607ab","observation_id":"a66b43db-033f-44c8-8391-c202067a4300","resolution":{"observed_at":"2026-08-14T04:26:52.827847Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2607.19376/citation-record","integrity":"/paper/2607.19376/integrity","json":"/paper/2607.19376/citation-record.json","paper":"/paper/2607.19376"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:15.331150Z","title":"Do ImageNet Classifiers Generalize to ImageNet?,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:15.331150Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:f347b44523d6fb1a9d90acd1c64b013d99ab75edc154847997bda8d49fd0077c","observation_id":"382a34ad-2906-4be7-bd24-d4217c96f9e2","resolution":{"observed_at":"2026-08-02T09:17:15.331150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:15.413600Z","title":"Hastie, R","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:15.413600Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:1218cb0ab4ecf0560f01481f5bd2b33d425ec97c5f1c21f24513b722a9cf46cb","observation_id":"9aae220a-5115-4d7a-bc98-04324f7c009c","resolution":{"observed_at":"2026-08-02T09:17:15.413600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:15.571466Z","title":"Cracking the black box of deep sequence-based protein–protein interaction prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:15.571466Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:588b0aea26d9cc2fe174e1e5f7a1876d6f7f53f8a473c92ff47f5a8073985bba","observation_id":"f14448c1-b3d4-4270-9e32-7c769915cc2f","resolution":{"observed_at":"2026-08-02T09:17:15.571466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:15.682142Z","title":"Leakage in data mining: Formulation, detection, and avoidance,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:15.682142Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:33b10d989e7886e805f22b0aff1c115741b7aa02127b83819bd0f05245fa9b21","observation_id":"a115d641-482d-4d1e-8d12-897b80991ad1","resolution":{"observed_at":"2026-08-02T09:17:15.682142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:15.780401Z","title":"Leakage and the reproducibility crisis in machine- learning-based science,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:15.780401Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:0786823b39e35fa07046effc8c576776eae43ab083aafcf95594fc933755bd46","observation_id":"3f395f60-962e-4574-8cf8-19b435cc2957","resolution":{"observed_at":"2026-08-02T09:17:15.780401Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:15.885321Z","title":"REFORMS: Consensus-based Recommendations for Machine-learning- based Science,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:15.885321Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:6888af6983b4c941627052002814406821e50ef3b26e4e85d04e65bed7e0b216","observation_id":"4e256359-ecec-4d7a-9717-a3b71703a2fe","resolution":{"observed_at":"2026-08-02T09:17:15.885321Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/bioinformatics/btl158","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cd-hit: a fast program for clustering and comparing large sets of protein or nucleotide sequences,","venue":"Bioinformatics","work_id":"afe8818f-4463-4dcf-8c9f-a0db70ef1076","year":2006},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:16.022753Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:765b36cfc540a019ce12570ec1c5e9978695fe44ad4532a3667e767870c4d509","observation_id":"9bb06874-67c8-4bae-98e3-1692990e5ab6","resolution":{"observed_at":"2026-08-02T09:18:26.428565Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:16.089357Z","title":"Effect of dataset partitioning strategies for evaluating out-of-distribution generalisation for predictive models in biochem - istry","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:16.089357Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:3cc014a0bb31bd923ae56d724e0ad7d921971fa549441a4ce97e146ca0a684d7","observation_id":"3a1503fb-0e24-4d6a-8ed6-db5fe936d031","resolution":{"observed_at":"2026-08-02T09:17:16.089357Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/pro.4362","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mechanisms of protein evolution,","venue":"Protein Science","work_id":"3a318aba-5223-4d48-a336-ca04eaa718b7","year":2022},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:16.165796Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:2d419fb1bd8e4ece483b98dff6367254d934d848e8200db2a694708122db7f22","observation_id":"67881109-731f-4998-8b68-027345b54f01","resolution":{"observed_at":"2026-08-02T09:18:26.127098Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/nar/30.7.1575","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An efficient algorithm for large-scale detection of protein families,","venue":"Nucleic Acids Research","work_id":"5915192d-8aae-41d0-b48c-9503962afd43","year":2002},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:16.312089Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:b3f281bada24f84e8d37061c3652e54656bc4bbb69263dd87d2db87c9b4e99ea","observation_id":"ade35ff1-56f6-496f-a403-7f025666978a","resolution":{"observed_at":"2026-08-02T09:18:25.907701Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:16.399384Z","title":"The Properties of Known Drugs. 1. Molecular Frameworks,","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:16.399384Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:a595d47dd15474c86357e9444466aa2110f4c1b2ac579de5478e6ac68a9851b3","observation_id":"848a08c6-b125-4830-86bc-8c25b799dac1","resolution":{"observed_at":"2026-08-02T09:17:16.399384Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1021/acs.jmedchem.2c01787","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Matched Molecular Pair Analysis in Drug Discovery: Methods and Recent Applications,","venue":"Journal of Medicinal Chemistry","work_id":"2644fa31-c6b8-466a-aa9d-c5e717c3dd28","year":2023},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:16.515288Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:60f3a39554580779c1b826501bb45a45c20472003817c843b41876951e228d15","observation_id":"9cdad9d1-b389-4524-86a7-8ab6e71b1d10","resolution":{"observed_at":"2026-08-02T09:18:25.631319Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:16.638429Z","title":"MoleculeNet: a benchmark for molecular machine learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:16.638429Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:576698e1d96894bcddab75e4da2c8e4276be817d0a0ba66ab4e6000980cb31ba","observation_id":"8b56a6d2-2fb8-49e1-8022-79ef45cf14fe","resolution":{"observed_at":"2026-08-02T09:17:16.638429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.64898/2026.02.03.703041","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"QMAP: A Benchmark for Standardized Evaluation of Antimicrobial Peptide MIC and Hemolytic Activity Regression,","venue":"bioRxiv (Cold Spring Harbor Laboratory)","work_id":"4f5755e6-e475-4a4f-b2b1-a1a9dd98d348","year":2026},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:16.762597Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:79de066ae1c2d9c88c93c7a820242c3ac11c780c06dce8f6e5bd4ef868251e1a","observation_id":"e756cfd6-371d-4711-ba53-5ae834615e77","resolution":{"observed_at":"2026-08-02T09:18:25.446100Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:16.876577Z","title":"DBAASP v3: database of antimicrobial/cytotoxic activity and structure of peptides as a resource for development of new therapeutics,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:16.876577Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:b7073dfd20d42e0f9463b2f87b3b46f26acd07076a9a407a6dbb5e69c8641b2b","observation_id":"d261f310-ec6e-4bc9-8c4a-4618d85365d4","resolution":{"observed_at":"2026-08-02T09:17:16.876577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:16.978150Z","title":"Data splitting to avoid information leakage with DataSAIL,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:16.978150Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:2234a54c9aac7c10c672b2c2ac453bab9f2c1287435fd6fac089b63f1d7fae86","observation_id":"42cbd8b1-7e00-4834-8e04-aeb69d4a9347","resolution":{"observed_at":"2026-08-02T09:17:16.978150Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:17.087083Z","title":"Lo-Hi: Practical ML Drug Discovery Benchmark,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:17.087083Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:f048390e9eb24e4bb63423458fd76cad858181e2638d38d5a2d8f3df1bf621b4","observation_id":"b2f9f296-1e28-4f17-8bcd-87f0d3dd7456","resolution":{"observed_at":"2026-08-02T09:17:17.087083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/nargab/lqad088","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GraphPart: homology partitioning for biological sequence analysis,","venue":"NAR Genomics and Bioinformatics","work_id":"006ea4ed-ba06-4517-acc7-ecae01680cb0","year":2023},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:17.278965Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:a0f6871057c4e191d0be37aa71c76b69a2773c796f7b40335389cbc5d2f4df78","observation_id":"b6c7f106-0758-40a2-8f51-241460979847","resolution":{"observed_at":"2026-08-02T09:18:25.333434Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/bioinformatics/btae555","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AutoPeptideML: a study on how to build more trustworthy peptide bioactivity predictors,","venue":"Bioinformatics","work_id":"9aab2771-d398-41cf-ae6e-953f46bf479c","year":2024},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:17.392675Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:a1062f25973845b1e9f70419313c01f9bd826a8a46050596a434e52ed8415f54","observation_id":"92b45de0-e250-4d2c-bafb-ca4d819ace6d","resolution":{"observed_at":"2026-08-02T09:18:25.247924Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/nargab/lqae106","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpanSeq: similarity-based sequence data splitting method for improved development and assessment of deep learning projects,","venue":"NAR Genomics and Bioinformatics","work_id":"2c060a6d-9775-4e3a-a707-7f346c26dc96","year":2024},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:17.451411Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:84050258b50ff7e9d2a2bd4714c414f58173eb1251fa9ad938190df62565f1fa","observation_id":"41bd7c11-0f0e-432a-99b0-8b6bc8a014b6","resolution":{"observed_at":"2026-08-02T09:18:25.164052Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:17.527516Z","title":"A density-based algorithm for discovering clusters in large spatial databases with noise,","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:17.527516Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:7fec390e7480419d436fe704f2f2f06ae0141beeeb263fa98ef4421f78ed1537","observation_id":"c795d991-2a5f-411a-a557-fb8d559c044f","resolution":{"observed_at":"2026-08-02T09:17:17.527516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:17.631746Z","title":"From Louvain to Leiden: guaranteeing well- connected communities,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:17.631746Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:af70431dc5b2d12aac5b8c23a99d81dd77af484ef24267658d681937ee790f7a","observation_id":"6e134815-d4b1-4cc6-b731-cde92117a60e","resolution":{"observed_at":"2026-08-02T09:17:17.631746Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:17.701896Z","title":"Efficient and Robust Approximate Nearest Neighbor Search Using Hierarchical Navigable Small World Graphs,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:17.701896Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:32dacca7db47ba33429dbce3bac8222184fbcd9ce6a8ad5b8dbdcad9ec9c9e50","observation_id":"4b48027c-d84b-4ff9-ad3e-6abcb7ee875c","resolution":{"observed_at":"2026-08-02T09:17:17.701896Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-1-4614-1800-9_33","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Community Structure in Graphs,","venue":"Computational Complexity","work_id":"5d1a71dc-cc57-4768-970f-bc5219656e06","year":2012},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:17.764583Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:9014960134ae9c13b821eb9e62e640ccc5de789060f8907938a83439aecaaa73","observation_id":"c46e4b3c-fe87-4499-9251-daf9c2228258","resolution":{"observed_at":"2026-08-02T09:18:25.034765Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:17.855254Z","title":"Parasail: SIMD C library for global, semi-global, and local pairwise sequence align- ments,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:17.855254Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:5e91b711485f01d2b54a693f63379692f30f81d337d2abd58e87c79baf4901cd","observation_id":"6c408d3e-9aff-4553-a3c4-08197270723f","resolution":{"observed_at":"2026-08-02T09:17:17.855254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41592-022-01585-1","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"US-align: universal structure alignments of proteins, nucleic acids, and macromolecular complexes,","venue":"Nature Methods","work_id":"8b117e2a-72b1-4848-bd49-f915a9a8938f","year":2022},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:17.950382Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:5395764357ef840bf4121b91d5a82faa975c68182c01dce153326e58cb92d678","observation_id":"71f3e003-dd07-44b6-a80f-c012b946ee69","resolution":{"observed_at":"2026-08-02T09:18:24.774746Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:18.045150Z","title":"Evolutionary-scale prediction of atomic-level protein structure with a language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:18.045150Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:a59ee2d1f05dc3908295c0e7e5205b3420370114e60ddd2a0401c50acc2b8705","observation_id":"92cc6e62-2b67-4a2e-aea0-87b9406d2848","resolution":{"observed_at":"2026-08-02T09:17:18.045150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:18.127880Z","title":"Identification of common molecular subsequences,","venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:18.127880Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:68be52800c0ad347a6e0b9779653ec0f2ed842b1b0ee6e5371a4dec22c9d7d42","observation_id":"c254915a-5e31-49a4-a40d-1f39a85e5702","resolution":{"observed_at":"2026-08-02T09:17:18.127880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:18.180681Z","title":"A general method applicable to the search for similarities in the amino acid sequence of two proteins,","venue":null,"work_id":null,"year":1970},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:18.180681Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:361d712732cd8a58f550eda8db0d302c3e8099384d8e0d3ad4fa03907df83e12","observation_id":"3b9f6e7d-d2d3-4069-825d-c52304f22e6a","resolution":{"observed_at":"2026-08-02T09:17:18.180681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:17.164717Z","title":"Available: https://openreview.net/forum?id=H2Yb28qGLV","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:17.164717Z"},"links":{"citing_paper":"/paper/2607.19376"},"observation_digest":"sha256:abc79c47814e1457e1526ab6c5797850c4f8f23e19e5d49ae47b561ec0021998","observation_id":"6e10ec4f-46ed-49ef-979c-3ca2d56824cd","resolution":{"observed_at":"2026-08-02T09:17:17.164717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.19376","last_updated":"2026-06-30T19:53:33Z","latest_version":1,"primary_category":"q-bio.QM","snapshot_observed_at":"2026-08-19T07:44:32.360066Z","submitted_at":"2026-06-30T19:53:33Z","title":"Refnd: Preventing Data Leakage in Relational Datasets"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":7,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":10,"verified_fuzzy":0},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 1 inbound Pith citation observation for arXiv:2607.19376."}