{"as_of":"2026-08-16T14:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:44485fbfd9d5e4997a3a2cc1640fb5621c7c85326ca3ce7e82fdbb0a26caaf8e","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:57:41.076689Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.17669/citation-record","integrity":"/paper/2411.17669/integrity","json":"/paper/2411.17669/citation-record.json","paper":"/paper/2411.17669"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.410636Z","title":"Transforming the language of life: transformer neural net works for protein prediction tasks,","venue":null,"work_id":"060cc38d-75a2-4c06-af59-c831c085be41","year":2020},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:40.975655Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:534d771e6588ba5d852c76f72ab8ea599cd20e826d1c4b7c2f560b83c4ee30c5","observation_id":"76ff52db-4d43-400e-9e0f-f39a58967edc","resolution":{"observed_at":"2026-08-12T11:57:41.414210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.399700Z","title":"Biological structure and function emerge from scaling unsupervised learning to 250 million protein s equences,","venue":null,"work_id":"921d8631-d28b-4d34-b804-4faf5baf7a23","year":2021},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:40.979927Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:fd6a47da9e685851df77662b4c8cc5c355ad604dd9eeba5da2f27658afd722d6","observation_id":"ea6049a1-f1cd-4771-a621-2544317de0d4","resolution":{"observed_at":"2026-08-12T11:57:41.403792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.388086Z","title":"Prottrans: Toward understanding the language of life through self-supervise d learning,","venue":null,"work_id":"c16e6638-27d8-4fa5-aa6c-63b07905737f","year":2021},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:40.983607Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:699185544c16031054dfd6153d50bc89e494906dd56caba85a62a11f34dda1c4","observation_id":"de6e54a1-2312-4974-a851-6eb7d8f86011","resolution":{"observed_at":"2026-08-12T11:57:41.391493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.378226Z","title":"The language of prote ins: Nlp, machine learning & protein sequences,","venue":null,"work_id":"2d3a303b-4a46-4aac-98ed-0067d78c02de","year":2021},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:40.987423Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:cfa1f101140b207fdd232eda3276dade1b6dfad17e0c0b5911a2a8d92650840f","observation_id":"8389e490-bddb-44c2-9998-8f2ea675177b","resolution":{"observed_at":"2026-08-12T11:57:41.381899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.367178Z","title":"Proteinbert: a universal deep-learning model of protein sequence and fun ction,","venue":null,"work_id":"7d278072-a2ba-4e88-b2f9-043186d9d0cc","year":2022},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:40.991478Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:d3eb8d5285360e2c0f83facc0cec83872de772b138c2dbbb4896f882fda42c64","observation_id":"db9c60d2-a273-4e60-a921-67a16b3d8d11","resolution":{"observed_at":"2026-08-12T11:57:41.370982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.357438Z","title":"Evolutionary-scale prediction of atomic- level protein structure with a language model,","venue":null,"work_id":"6cf142a4-9a8e-4d07-b9c8-33e5389189a3","year":2023},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:40.994996Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:bcdea35fa5be8c73a0b336890f0991c9993404df21ec6f1ea74769e5510ab024","observation_id":"6455a2c0-e70e-4094-81ae-71d4f8ad64d7","resolution":{"observed_at":"2026-08-12T11:57:41.361134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.06568","last_updated":"2023-01-16T19:04:45Z","snapshot_observed_at":"2026-08-13T13:03:36.757580Z","submitted_at":"2023-01-16T19:04:45Z","title":"Ankh: Optimized Protein Language Model Unlocks General-Purpose Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.06568","snapshot_observed_at":"2026-08-12T11:57:40.998637Z","title":"Ankh: Optimized protein languag e model unlocks general-purpose modelling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:40.998637Z"},"links":{"cited_paper":"/paper/2301.06568","citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:052956dcdff0e5923bd0cbbb7dda41988c95a2afffcf5a82198f2800fb687598","observation_id":"0fe3da6f-ef84-45e2-bf50-df1cb35790f5","resolution":{"observed_at":"2026-08-12T11:57:40.998637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17415","last_updated":"2023-10-26T14:20:44Z","snapshot_observed_at":"2026-08-16T14:48:37.244744Z","submitted_at":"2023-10-26T14:20:44Z","title":"PETA: Evaluating the Impact of Protein Transfer Learning with Sub-word Tokenization on Downstream Applications","version":1},"cited_work":{"arxiv_id":"2310.17415","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.17415","snapshot_observed_at":"2026-08-12T11:57:41.123215Z","title":"PETA: Evaluating the Impact of Protein Transfer Learning with Sub-word Tokenization on Downstream Applications","venue":"cs.CL","work_id":"02c98dea-4eb0-4be6-a3d6-ada6d484eee8","year":2023},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:41.002409Z"},"links":{"cited_paper":"/paper/2310.17415","citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:518b3e44a63707bd12df8cf4f6e0c157d2410ea26c1984c7350696a628b3594c","observation_id":"35c7243d-f71c-4328-9eec-67290902e2ae","resolution":{"observed_at":"2026-08-12T11:57:41.129445Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.347060Z","title":"Effect o f tokenization on transformers for biological sequences,","venue":null,"work_id":"258d3aee-8bbf-4451-93ba-22140a946e28","year":2024},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:41.006175Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:9e9a99ceed8fc3cfbed437272753334d2f51fb6e2ad77f9a98db559cfad7079c","observation_id":"b799efa8-bcf0-4e9d-a622-c2e84545f277","resolution":{"observed_at":"2026-08-12T11:57:41.350937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.337133Z","title":"Protein langu age models meet reduced amino acid alphabets,","venue":null,"work_id":"f7f0b99e-66e5-4561-9d8e-ee329445c1e3","year":2024},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:41.009824Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:c223479319f1010145cbba79e0629ee5c5ca2b9eed46d46cd139a06b346a59b7","observation_id":"e7977724-d930-4994-a4b6-d5ed98409ef4","resolution":{"observed_at":"2026-08-12T11:57:41.340696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15222","last_updated":"2021-03-28T21:56:26Z","snapshot_observed_at":"2026-08-13T22:18:06.264865Z","submitted_at":"2020-06-26T21:50:17Z","title":"BERTology Meets Biology: Interpreting Attention in Protein Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.15222","snapshot_observed_at":"2026-08-12T11:57:41.013343Z","title":"Bertology meets biology: Interpreting attention in prote in language models,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:41.013343Z"},"links":{"cited_paper":"/paper/2006.15222","citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:61b8d10f004c340a44753f5ef32e04d50584ddbf143c74ac8f9156e7e0f9a150","observation_id":"85d7566b-4d83-4bbf-9976-83707e44f944","resolution":{"observed_at":"2026-08-12T11:57:41.013343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.326345Z","title":"Transformer protein language models are unsupervised structure learne rs,","venue":null,"work_id":"d3adde8a-4639-4d24-a4c5-dfeb1579dae9","year":2020},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:41.017156Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:4bde8af87676c897dcf8f53d790e0a6cd834e342de02526208b6df9f68b490d3","observation_id":"4dd0b20f-b526-495c-873f-94a2e4bdfb59","resolution":{"observed_at":"2026-08-12T11:57:41.330074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.315314Z","title":"Exploring data-driven chem ical smiles tokenization approaches to identify key protein–ligand bi nding moieties,","venue":null,"work_id":"0a199b35-c154-411c-97f8-6c65bf2162ca","year":2024},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:41.020269Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:bf71b8a15fd642820abfc23fdf3ef5cb75ba0188ca29e9ef3c38c207905c9208","observation_id":"ccb9840c-07c9-431f-82ed-91d9eacafbab","resolution":{"observed_at":"2026-08-12T11:57:41.319052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.305212Z","title":"The organization of domains in proteins obeys menzerath-altmann’s law of lan guage,","venue":null,"work_id":"81116003-1189-44e7-9ff1-65eb0054c882","year":2015},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:41.023378Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:b2fab29a0669b1a449cac292cd56426faa8a5d324280ba7be83322d017a5d107","observation_id":"0914d502-03b6-47f3-8275-7ad58ac4cc5c","resolution":{"observed_at":"2026-08-12T11:57:41.308970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.295591Z","title":"Ling uistic laws in biology,","venue":null,"work_id":"f793c167-fe27-4a40-b7a3-ec453bb91dd6","year":2022},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:41.026459Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:f41c42f5f13ae9b1b4a3108e142b7d55eea132810cc004e6283b2610165a6628","observation_id":"45257caf-bcca-4b05-85df-6947a33aeed0","resolution":{"observed_at":"2026-08-12T11:57:41.299240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.285156Z","title":"Sapr ot: Protein language modeling with structure-aware vocabulary,","venue":null,"work_id":"e5e1f200-47c1-4458-9728-48261f4e5a8b","year":2023},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:41.029686Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:053374617b730b6e7500e3040524a03326bd37ee41203183ffdac8c3d68fad64","observation_id":"d86ec17f-0f09-4a1c-be31-d27329d7977f","resolution":{"observed_at":"2026-08-12T11:57:41.289176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.275586Z","title":"Bilingual language model for pr otein sequence and structure,","venue":null,"work_id":"e521a1c5-57a0-4ea7-be40-89a27a7a0197","year":2023},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:41.032867Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:5f4bdf24ccb388bb4ba1b5c9c019e8e1927dc8f11fdae5195be186903c15dc2e","observation_id":"3b43bea3-5741-4482-a8a0-736bf77d234b","resolution":{"observed_at":"2026-08-12T11:57:41.279029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.265339Z","title":"Fast and accurate protein structure search with foldseek,","venue":null,"work_id":"7b1ec18f-9f3c-42cc-9cb4-c337d8ee9369","year":2024},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:41.036167Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:1542a85c02059ca40fdc53c5b47c1b465365f2d8e4ef8ade0852b9796576b93e","observation_id":"990981be-718c-488b-99e1-db602752f0b3","resolution":{"observed_at":"2026-08-12T11:57:41.269181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.255750Z","title":"Neural machine tr anslation of rare words with subword units,","venue":null,"work_id":"e75abf50-b40e-4363-be8e-992d2b524a39","year":2016},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:41.039342Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:d824c9175d31f5b1bd433c6b509d5db05b0a7725a551a20f8226d0c7aaaa4000","observation_id":"e9eafabb-18ee-4383-a2d5-9a8f545daad9","resolution":{"observed_at":"2026-08-12T11:57:41.259454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.08144","last_updated":"2016-10-08T19:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-26T19:59:55Z","title":"Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08144","snapshot_observed_at":"2026-08-12T11:57:41.042802Z","title":"Google’s neural machine translation system: Bridging the gap between human and machine translation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:41.042802Z"},"links":{"cited_paper":"/paper/1609.08144","citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:9677ee159515fc4b1ad1cc8684440ed99fa88e35b56a1702ccb1d9f2c488aec2","observation_id":"7b3f1669-51f6-4054-8424-b6b2c5fd8c81","resolution":{"observed_at":"2026-08-12T11:57:41.042802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.245057Z","title":"Sentencepiece: A simple and language inde- pendent subword tokenizer and detokenizer for neural text p rocessing,","venue":null,"work_id":"88d06e4b-904e-450c-a69e-3ebcaf178693","year":2018},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:41.046227Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:cdd9f4392a8de8b60d5c1fef36c10aefbb5cce883460830ad67edf2cdfea4bf4","observation_id":"6dfb1f17-ffec-4bbe-b604-c682942cb75b","resolution":{"observed_at":"2026-08-12T11:57:41.249087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.233312Z","title":"Subword regularization: Improving neural ne twork transla- tion models with multiple subword candidates,","venue":null,"work_id":"46e3895c-d423-43af-9824-050964d7f5a8","year":2018},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:41.049621Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:b5644e02abf1046011b4f45f65a5f3f8a03c49e9bef5766d1cab9b13fc7ac78e","observation_id":"f1419a2c-ecf4-433b-9e76-be8d05484eef","resolution":{"observed_at":"2026-08-12T11:57:41.237662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.222469Z","title":"Uniref: comprehensive and non-redundant uniprot referen ce clusters,","venue":null,"work_id":"ae75ed92-fa47-42e6-a153-90629b5632ec","year":2007},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:41.052970Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:3c7e61cac3920eafd4ecc013e79abd8880c96e3f145eb4fc46a2ae49e4474b03","observation_id":"ce91a240-4115-4a1b-845f-37bedf444533","resolution":{"observed_at":"2026-08-12T11:57:41.226498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.211947Z","title":"Pointe r sentinel mixture models,","venue":null,"work_id":"4c11aaf2-c5aa-4c7d-98ff-7df24859cd80","year":2016},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:41.056286Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:cd7b6752bedafe91490bfb19eab1da4f6279f6225322613eb726466f50dcea48","observation_id":"6a45fb72-dc20-4921-b016-9734300e88a7","resolution":{"observed_at":"2026-08-12T11:57:41.215697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.200701Z","title":"Incorporating context into subword vocabu- laries,","venue":null,"work_id":"05d1052e-3f7a-4dcd-957f-8d8cddbe3ccd","year":2023},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:41.059664Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:ed83a996f051822487c055b130f1ec11a86371d57556b121a03220b25f34740d","observation_id":"1538b3ee-5d28-4265-af2f-d6fd3102e88a","resolution":{"observed_at":"2026-08-12T11:57:41.204674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.189989Z","title":"New and continuing develo pments at prosite,","venue":null,"work_id":"3554eca4-8dc9-4c06-8278-66a31b879225","year":2012},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:41.062868Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:6dd8813faf9e092617d432ed7d24c3344471b1b871f31b946599205dc6f08692","observation_id":"59f4f506-49ca-4391-931c-e2ae6116cbc2","resolution":{"observed_at":"2026-08-12T11:57:41.193591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.179174Z","title":null,"venue":null,"work_id":"f1e62b04-ed47-4add-8c48-8c9828ece9d2","year":1949},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:41.066591Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:32ff6a4bacf1299d0ff6f8f42109e737da9155e42e5c6f95097076bd89b695b8","observation_id":"b15398e9-4ed9-4f74-b9d9-076da6246af1","resolution":{"observed_at":"2026-08-12T11:57:41.183329Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.168119Z","title":"On the physical origin of linguistic laws and lo gnormality in speech,","venue":null,"work_id":"7facdb25-88fb-435d-a564-043d224a2db8","year":2019},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:41.070176Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:3a231d0a7aa5ba60a8898f51c170bf7d9294af2348fac6c5e67ee0951bf9944f","observation_id":"db8860f0-9487-455b-91e4-9eb26da019df","resolution":{"observed_at":"2026-08-12T11:57:41.172103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.157585Z","title":null,"venue":null,"work_id":"1da0de3f-2ece-4101-91a5-fb631960686a","year":1978},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:41.073421Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:568198f70ed84183d6b85b7dee2ada4768ab94955eaacae8e0f8b6e47e53477a","observation_id":"236c4f65-26d4-4746-8d2c-d205aff38675","resolution":{"observed_at":"2026-08-12T11:57:41.160960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:41.146653Z","title":"Prolegomena to menzerath’s law,","venue":null,"work_id":"f561c80e-8183-4cfb-847b-5928cd9e3fef","year":1980},"citing_paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:41.076689Z"},"links":{"citing_paper":"/paper/2411.17669"},"observation_digest":"sha256:798012b8fe183db04883e6f16fd9867415f9400f7b73e12cfae1bd01e74346dd","observation_id":"250c5b75-d9c9-4177-86d1-1cd61dd288f7","resolution":{"observed_at":"2026-08-12T11:57:41.150180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.17669","last_updated":"2024-11-26T18:30:20Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T15:45:37.571391Z","submitted_at":"2024-11-26T18:30:20Z","title":"Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":1,"verified_fuzzy":24},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2411.17669."}