{"as_of":"2026-08-14T14:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:af3492cf002ffb37fcfd909fece84dbcc81ec6f5b821d41603115379de74ff21","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:54:44.629337Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.12240/citation-record","integrity":"/paper/2411.12240/integrity","json":"/paper/2411.12240/citation-record.json","paper":"/paper/2411.12240"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:54:45.360255Z","title":"Future applications of generative large language models: A data-driven case study on ChatGPT,","venue":null,"work_id":"6ba327d4-d8a1-4e3c-aeed-0ca0e533d4b5","year":2024},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.457136Z"},"links":{"citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:479ad59fadf0527e130370c17562af0c5885c7380f9bb5921596e471166b961c","observation_id":"b307a898-43ce-4a72-826a-247b91890e07","resolution":{"observed_at":"2026-08-12T17:54:45.365443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11903","last_updated":"2024-06-15T16:11:35Z","snapshot_observed_at":"2026-08-14T08:35:48.053147Z","submitted_at":"2024-06-15T16:11:35Z","title":"A Survey of Large Language Models for Financial Applications: Progress, Prospects and Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11903","snapshot_observed_at":"2026-08-12T17:54:44.463460Z","title":"A Survey of Large Language Models for Financial Applications: Progress, Prospects and Challenges,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.463460Z"},"links":{"cited_paper":"/paper/2406.11903","citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:ed44f245d22a865a963eadaf7399806435cc9dd5fce90b71ef4ec5c79874558a","observation_id":"bdc5874f-b701-48c3-8d8f-0f4157f2eb87","resolution":{"observed_at":"2026-08-12T17:54:44.463460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03718","last_updated":"2024-09-28T04:00:29Z","snapshot_observed_at":"2026-08-14T08:57:40.476175Z","submitted_at":"2024-09-28T04:00:29Z","title":"Performance Evaluation of Tokenizers in Large Language Models for the Assamese Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03718","snapshot_observed_at":"2026-08-12T17:54:44.469236Z","title":"Performance Evaluation of Tokenizers in Large Language Models for the Assamese Language,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.469236Z"},"links":{"cited_paper":"/paper/2410.03718","citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:2a849505bed266c4550db51d3e043b0b2c4d77105e65b39781b40887a4d1136f","observation_id":"9e196a95-df44-4810-95b1-b367abf80d81","resolution":{"observed_at":"2026-08-12T17:54:44.469236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11214","last_updated":"2024-11-14T03:53:56Z","snapshot_observed_at":"2026-08-14T08:36:19.511643Z","submitted_at":"2024-06-17T05:13:25Z","title":"Problematic Tokens: Tokenizer Bias in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11214","snapshot_observed_at":"2026-08-12T17:54:44.475699Z","title":"Large Language Model Tokenizer Bias: A Case Study and Solution on GPT-4o,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.475699Z"},"links":{"cited_paper":"/paper/2406.11214","citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:9a5883b9ba80a54ef898fdf20012b198f0e54250761d7572b1dbdbb33c9fd37c","observation_id":"c4ce1d40-672f-40b4-919f-9c96686dd475","resolution":{"observed_at":"2026-08-12T17:54:44.475699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15524","last_updated":"2021-10-05T22:18:32Z","snapshot_observed_at":"2026-08-14T08:37:40.498406Z","submitted_at":"2020-12-31T10:01:29Z","title":"Fast WordPiece Tokenization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15524","snapshot_observed_at":"2026-08-12T17:54:44.482728Z","title":"Fast WordPiece Tokenization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.482728Z"},"links":{"cited_paper":"/paper/2012.15524","citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:0748dd2a3752923744f154c137d4d897b06e7cd036ba38916a14a1fb3ab2d618","observation_id":"93670e64-474c-4aa9-abfc-dccfb31b51fb","resolution":{"observed_at":"2026-08-12T17:54:44.482728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.05481","last_updated":"2022-10-11T14:32:46Z","snapshot_observed_at":"2026-08-14T08:34:22.839963Z","submitted_at":"2022-10-11T14:32:46Z","title":"Better Than Whitespace: Information Retrieval for Languages without Custom Tokenizers","version":1},"cited_work":{"arxiv_id":"2210.05481","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.05481","snapshot_observed_at":"2026-08-12T17:54:45.107488Z","title":"Better Than Whitespace: Information Retrieval for Languages without Custom Tokenizers","venue":"cs.CL","work_id":"5f177fba-c295-4ff6-9fd1-ae967f08730a","year":2022},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.488420Z"},"links":{"cited_paper":"/paper/2210.05481","citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:05d5b79ec1f2571d87659f79522ed52abfea46c28baae43a40a044ba4ccedad9","observation_id":"4d168711-a754-48e4-9afa-1be96606319e","resolution":{"observed_at":"2026-08-12T17:54:45.116212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08671","last_updated":"2024-11-13T15:04:02Z","snapshot_observed_at":"2026-08-13T04:11:44.218812Z","submitted_at":"2024-11-13T15:04:02Z","title":"Theoretical Analysis of Byte-Pair Encoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08671","snapshot_observed_at":"2026-08-12T17:54:44.495748Z","title":"Theoretical Analysis of Byte-Pair Encoding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.495748Z"},"links":{"cited_paper":"/paper/2411.08671","citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:c8f522ca14078c2999f383822dbf6ef54f7a602dc8e4cc8c2a34c23ed9f225a2","observation_id":"9e05e673-3fa1-45a6-82c4-98086381ac5a","resolution":{"observed_at":"2026-08-12T17:54:44.495748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16837","last_updated":"2024-09-02T08:33:21Z","snapshot_observed_at":"2026-08-14T08:34:22.354852Z","submitted_at":"2023-06-29T10:29:23Z","title":"A Formal Perspective on Byte-Pair Encoding","version":3},"cited_work":{"arxiv_id":"2306.16837","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.16837","snapshot_observed_at":"2026-08-12T17:54:45.050784Z","title":"A Formal Perspective on Byte-Pair Encoding","venue":"cs.CL","work_id":"6c8bd1ff-4d54-4af6-b43a-8f8f32c99e45","year":2023},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.507691Z"},"links":{"cited_paper":"/paper/2306.16837","citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:0b10562929e95162503eae4e049462f514975ada9ea9eaeefdce730534127bb2","observation_id":"f4da99aa-bb51-4302-bbf6-8a9d2fbd2d83","resolution":{"observed_at":"2026-08-12T17:54:45.056557Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16816","last_updated":"2024-08-07T19:47:21Z","snapshot_observed_at":"2026-08-13T00:22:03.160794Z","submitted_at":"2024-04-25T17:57:36Z","title":"IndicGenBench: A Multilingual Benchmark to Evaluate Generation Capabilities of LLMs on Indic Languages","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16816","snapshot_observed_at":"2026-08-12T17:54:44.514121Z","title":"IndicGenBench: A Multilingual Benchmark to Evaluate Generation Capabilities of LLMs on Indic Languages,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.514121Z"},"links":{"cited_paper":"/paper/2404.16816","citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:0379e1fca65a2e4630905c5cb29c924b22ee4b189b5aee0f65d8826a49824837","observation_id":"9f134283-c4fb-4a41-b185-28cd5f01f74f","resolution":{"observed_at":"2026-08-12T17:54:44.514121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:54:45.342327Z","title":"EU Tokenizer Performance,","venue":null,"work_id":"8cd0c3f3-b701-47cd-89ba-2271cdd65db5","year":2024},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.520706Z"},"links":{"citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:a58a78de1c2b7f8693af940ab2f56c8412909af38b7f66ee5d057ace60eff701","observation_id":"65a09826-9ad3-4417-be83-2a23f7364573","resolution":{"observed_at":"2026-08-12T17:54:45.348250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:54:45.325866Z","title":"Tokenizer performance on EU languages,","venue":null,"work_id":"96a7a6a7-60b1-425b-bbb5-aea67029dbc6","year":2023},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.525997Z"},"links":{"citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:edcdc576e2f4611f16bfee799d89afb4fc809641743693484c32e044916b4122","observation_id":"c7feb563-ae2d-4fe0-89a8-13e459f578f1","resolution":{"observed_at":"2026-08-12T17:54:45.330806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01035","last_updated":"2024-02-07T10:51:11Z","snapshot_observed_at":"2026-08-13T04:28:50.593476Z","submitted_at":"2024-02-01T21:49:34Z","title":"Getting the most out of your tokenizer for pre-training and domain adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01035","snapshot_observed_at":"2026-08-12T17:54:44.532574Z","title":"Getting the most out of your tokenizer for pre-training and domain adaptation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.532574Z"},"links":{"cited_paper":"/paper/2402.01035","citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:805bd5b54abda005290c7612e48b5d79dc6f665eb1c722014d3b6e59ee9d497a","observation_id":"d1276e2f-baa4-4a15-be6f-dd0ab55f55bd","resolution":{"observed_at":"2026-08-12T17:54:44.532574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:54:45.309152Z","title":"Exploring the New Frontier of AI: OpenAI’s GPT-4-O for Indic Languages,","venue":null,"work_id":"e0dfee79-d114-4028-9bce-79dc61465e61","year":null},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.537517Z"},"links":{"citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:9269fe329dd064dea15166d6b4772673294e2d8f58b4254f87e3d407d326ffa0","observation_id":"57728926-8cd4-431f-ab3d-e4fd7e58c836","resolution":{"observed_at":"2026-08-12T17:54:45.314664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T17:54:44.548238Z","title":"GPT-4 Technical Report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.548238Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:3df4a8eefd2e4ea33e7f254e373c9db1ec1a6cab92d199764b0ca32b7488123e","observation_id":"24fdd2f3-b6eb-4552-8d77-401b8ef443c8","resolution":{"observed_at":"2026-08-12T17:54:44.548238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06694","last_updated":"2024-05-07T20:11:44Z","snapshot_observed_at":"2026-08-13T00:12:47.362644Z","submitted_at":"2024-05-07T20:11:44Z","title":"SUTRA: Scalable Multilingual Language Model Architecture","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06694","snapshot_observed_at":"2026-08-12T17:54:44.553032Z","title":"SUTRA: Scalable Multilingual Language Model Architecture,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.553032Z"},"links":{"cited_paper":"/paper/2405.06694","citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:f52bb2fe57c534dcbdf835c14e074f36bf72150b8abb5081ba47cb14430d56d7","observation_id":"ddd4f0dd-65bb-4b9b-9d5d-5a545d785210","resolution":{"observed_at":"2026-08-12T17:54:44.553032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12345","last_updated":"2025-06-17T20:37:32Z","snapshot_observed_at":"2026-08-13T04:37:25.423033Z","submitted_at":"2024-01-22T20:20:48Z","title":"Distributionally Robust Receive Combining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12345","snapshot_observed_at":"2026-08-12T17:54:44.559532Z","title":"Available at: https: //arxiv.org/abs/2401.12345","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.559532Z"},"links":{"cited_paper":"/paper/2401.12345","citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:093fbc30c6e9d27a65483b6c27ab1a1b19a825f3536ab96bfc4483e37a12b250","observation_id":"3c1138af-fa54-42d5-b563-8d454189ddcf","resolution":{"observed_at":"2026-08-12T17:54:44.559532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T17:54:44.564594Z","title":"The Llama 3 Herd of Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.564594Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:149543dfd9cff23b9417729aa4529fc806297cfc427745cb768c1a65664d896b","observation_id":"d55eef09-3f1e-4fea-8c52-51212f13dca0","resolution":{"observed_at":"2026-08-12T17:54:44.564594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06196","snapshot_observed_at":"2026-08-12T17:54:44.569735Z","title":"Large Language Models: A Survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.569735Z"},"links":{"cited_paper":"/paper/2402.06196","citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:1771ef1e690e56508d3847b7268c0c512ed0d943535b558d039a2119127fc860","observation_id":"f1efb486-06c9-4ee2-831c-ee9a07d27476","resolution":{"observed_at":"2026-08-12T17:54:44.569735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06435","snapshot_observed_at":"2026-08-12T17:54:44.576196Z","title":"A Comprehensive Overview of Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.576196Z"},"links":{"cited_paper":"/paper/2307.06435","citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:6aad0f6f1954d1acf62a97367900bf8272f29d3f38e3372c8ca24bcd6e71f72a","observation_id":"9c002b24-a011-407e-9aae-565566611598","resolution":{"observed_at":"2026-08-12T17:54:44.576196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:54:45.292151Z","title":"Multilingual Tokenization Efficiency in Large Language Models: A Study on Indian Languages,","venue":null,"work_id":"34471f8c-ad7a-4355-b389-953d3cfaf695","year":null},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.581199Z"},"links":{"citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:9c52c2aee078cf3dbc7ae1dd2c223768c28c74c3c5a8073ba5d2f3d341e9b8ec","observation_id":"19316873-8bf3-4147-a305-6d729d8c49b7","resolution":{"observed_at":"2026-08-12T17:54:45.298041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:54:44.587223Z","title":"Impact of Tokenization on Language Models: An Analysis for Turkish,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.587223Z"},"links":{"citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:9cce889544839f23379578e003b4df6b4816f1bfc78a1fb3f097dca421ed579c","observation_id":"792b8595-885a-47bd-9ac3-52acfb58d6c0","resolution":{"observed_at":"2026-08-12T17:54:44.587223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:54:45.275075Z","title":"Generative Models For Indic Languages: Evaluating Content Generation Capabilities","venue":null,"work_id":"704507e9-523e-4441-b2e6-b37a3f395e6b","year":2023},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.592173Z"},"links":{"citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:0de270e3f546589f521d4afaedc090ff333747c87fc121c26e418beef4f8d5ba","observation_id":"0b9737d6-8c6e-4504-b487-9124b746303e","resolution":{"observed_at":"2026-08-12T17:54:45.280154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:54:44.597231Z","title":"IndicGenBench: A Multilingual Benchmark to Evaluate Generation Capabilities of LLMs on Indic Languages","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.597231Z"},"links":{"citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:fb5a173a58fc8ba4a4d850cc33bb78b944ceab253ddb60345a3b9110b7906856","observation_id":"33426183-9ddc-409a-b3d2-061d52ecd62e","resolution":{"observed_at":"2026-08-12T17:54:44.597231Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13522","last_updated":"2025-02-24T05:37:48Z","snapshot_observed_at":"2026-08-12T23:19:27.806453Z","submitted_at":"2024-07-18T13:57:16Z","title":"INDIC QA BENCHMARK: A Multilingual Benchmark to Evaluate Question Answering capability of LLMs for Indic Languages","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13522","snapshot_observed_at":"2026-08-12T17:54:44.602678Z","title":"Indic QA Benchmark: A Multilingual Benchmark to Evaluate Question Answering Capability of LLMs for Indic Languages","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.602678Z"},"links":{"cited_paper":"/paper/2407.13522","citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:a66dcbc09c50cd05a678b961cb6bf00628a947c9c59dac2a6f71076da78a439b","observation_id":"498a5256-af69-4339-9302-d4c3f9b80264","resolution":{"observed_at":"2026-08-12T17:54:44.602678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:54:44.608824Z","title":"IndicNLG Benchmark: Multilingual Datasets for Diverse NLG Tasks in Indic Languages","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.608824Z"},"links":{"citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:d1eed36d2cc9532c1396d7f652a17c175bec0c1797339f370fc7a18f88f5d214","observation_id":"e7b7e122-125e-44e2-b945-98b1d830029c","resolution":{"observed_at":"2026-08-12T17:54:44.608824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07540","last_updated":"2021-09-28T21:48:54Z","snapshot_observed_at":"2026-08-13T19:04:04.421724Z","submitted_at":"2021-06-14T16:05:58Z","title":"Evaluating Various Tokenizers for Arabic Text Classification","version":2},"cited_work":{"arxiv_id":"2106.07540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.07540","snapshot_observed_at":"2026-08-12T17:54:44.722482Z","title":"Evaluating Various Tokenizers for Arabic Text Classification","venue":"cs.CL","work_id":"5e0e599b-5059-4bc4-913b-8ff93bf3364e","year":2021},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.613732Z"},"links":{"cited_paper":"/paper/2106.07540","citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:f88d95121e5fb09ba60143fbb9ec247e96918083b88151c344e09526b6780b22","observation_id":"7693b119-1852-4f86-ad18-c313674a8d44","resolution":{"observed_at":"2026-08-12T17:54:44.732025Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:54:45.232340Z","title":"Eighth Schedule,","venue":null,"work_id":"33b5645b-4472-49e1-bc1e-c001828fee0b","year":2023},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.619631Z"},"links":{"citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:cfdd615358f91611b3f3e97b7ed28ebfa2118e3606db844805d396b1e3a3714a","observation_id":"7b91a00b-0822-40a1-8bc1-7fd2e9e8305a","resolution":{"observed_at":"2026-08-12T17:54:45.237388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15053","last_updated":"2024-10-18T08:51:55Z","snapshot_observed_at":"2026-08-12T23:37:37.269709Z","submitted_at":"2024-06-21T11:00:38Z","title":"PARIKSHA: A Large-Scale Investigation of Human-LLM Evaluator Agreement on Multilingual and Multi-Cultural Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15053","snapshot_observed_at":"2026-08-12T17:54:44.624855Z","title":"PARIKSHA: A Large-Scale Investigation of Human-LLM Evaluator Agreement on Multilingual and Multi-Cultural Data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.624855Z"},"links":{"cited_paper":"/paper/2406.15053","citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:834c686cc90640a6ce103f6612de7740799b69b2ffaa955d590b57251337be38","observation_id":"c6ebf67c-6188-4f0e-bc60-68bd0e310338","resolution":{"observed_at":"2026-08-12T17:54:44.624855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:54:45.213003Z","title":"জীৱনৰ পিৰসেৰ মািহত হাৱােটা বানীয়।","venue":null,"work_id":"7509688c-deb8-43e9-8907-ebc96900fd76","year":1930},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.629337Z"},"links":{"citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:117c046de48c82e03439d3633e79221683dc780dde18b81e27e3ad876a883a6f","observation_id":"e5248096-f133-4a6b-ae11-dea79b005ed2","resolution":{"observed_at":"2026-08-12T17:54:45.218843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"-o-for-indic-languages/4142383","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:54:44.980484Z","title":"Available: https://techcommunity.microsoft.com/blog/azure-ai-services-blog/ exploring-the-new-frontier-of-ai-openais-gpt-4-o-for-indic-languages/4142383","venue":null,"work_id":"10d93ca8-236c-4117-bcfc-9a865f1b06eb","year":null},"citing_paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T17:54:44.543187Z"},"links":{"citing_paper":"/paper/2411.12240"},"observation_digest":"sha256:acf95449b5480642819c876d9847d9e25333c997d00df167095a60b9989fc9ce","observation_id":"19088322-b37b-499c-aa0c-1b9c568e0d2e","resolution":{"observed_at":"2026-08-12T17:54:44.989557Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.12240","last_updated":"2024-11-26T18:14:50Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T08:34:10.971312Z","submitted_at":"2024-11-19T05:37:17Z","title":"Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":4,"verified_fuzzy":8},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2411.12240."}