{"as_of":"2026-08-10T13:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:51a47e343d5c5eb875cf8f29096de07fb902b5f47d05defe16539a4eb8edb092","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:56:45.919746Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.16868/citation-record","integrity":"/paper/2505.16868/integrity","json":"/paper/2505.16868/citation-record.json","paper":"/paper/2505.16868"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:53.518078Z","title":null,"venue":null,"work_id":"28929c9f-cc69-4589-8aa7-7ef52bb107d0","year":2002},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:40.732995Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:84381328463a5657c7c514a6a85b30b7d094d6ece77c8653788983e688ccb6fd","observation_id":"fb1ca4a8-9723-42c3-a201-cce50e45c2b7","resolution":{"observed_at":"2026-08-07T14:56:53.598816Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:53.227267Z","title":"An awkward disparity between BLEU/RIBES scores and human judgements in machine translation","venue":null,"work_id":"389c8c04-8256-4fd5-a34a-b35ba9be6c6d","year":2015},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:40.813720Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:17e82074f10565df34924771d7822bd9d14579451cd5c08418c98512c6403012","observation_id":"0156cc44-19ec-44c7-940b-1662bb841aaf","resolution":{"observed_at":"2026-08-07T14:56:53.378184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:52.967030Z","title":"METEOR: An automatic metric for MT evaluation with improved correlation with human judgments","venue":null,"work_id":"5d75c26c-949c-45fd-846d-bb76d15820ab","year":2005},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:40.920925Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:9da9026c62518701bc9a25c4df5d9f2636434e394a6e1aaa81abc59f6da47552","observation_id":"c4150d97-819e-4845-9aaf-13846d41016b","resolution":{"observed_at":"2026-08-07T14:56:53.114813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:52.696675Z","title":"A study of translation edit rate with targeted human annotation","venue":null,"work_id":"bda609b5-f30d-49f2-a0a4-8c2aace2eb49","year":2006},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.000492Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:a4d235a9591fe730c0c9dfaf087ef9618b731099a8e72715879cff2c85224827","observation_id":"bb282389-3dcd-4731-9c10-a63a2318367b","resolution":{"observed_at":"2026-08-07T14:56:52.849174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:52.492232Z","title":"chrF: character n -gram F-score for automatic MT evaluation","venue":null,"work_id":"1ab8f0c1-067b-47db-ba7e-dee722ddc9ca","year":2015},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.108401Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:d67ae499a216e77f3cab1e611ecd898d36426e19560eea1cb24d5ed2cf31b1e5","observation_id":"585289e0-bb35-4ec9-81ae-36141b49a028","resolution":{"observed_at":"2026-08-07T14:56:52.584017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09025","last_updated":"2020-10-19T14:10:10Z","snapshot_observed_at":"2026-08-04T14:24:24.611946Z","submitted_at":"2020-09-18T18:54:15Z","title":"COMET: A Neural Framework for MT Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09025","snapshot_observed_at":"2026-08-07T14:56:41.199975Z","title":"C., & Lavie, A","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.199975Z"},"links":{"cited_paper":"/paper/2009.09025","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:8c878cfaa928cc1b2111f7de9d87cdebf00e0e0022ab3eab398a669503addb75","observation_id":"e6ea1fe1-48fa-4e29-9ab5-29f925f3497f","resolution":{"observed_at":"2026-08-07T14:56:41.199975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:52.310585Z","title":null,"venue":null,"work_id":"188c1447-285a-4e72-a15b-d183e7e077b6","year":2022},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.284404Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:ee6dac826159db661b2c5ce6bdd881d82df2b366718cdd7549fc52a3770d5763","observation_id":"1ebcd9e6-1d42-4f66-ad66-bf03338a7f47","resolution":{"observed_at":"2026-08-07T14:56:52.396246Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-07T14:56:41.422461Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.422461Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:e3be2cdefdfaa1de991f9c0059780b14c30c6f029fbfb52809dcb3404c998941","observation_id":"58ae7b42-df44-452a-afe3-5a15d57f399f","resolution":{"observed_at":"2026-08-07T14:56:41.422461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-07-06T04:28:16.222296Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-07T14:56:41.529877Z","title":"Neural machine translation of rare words with subword units","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.529877Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:77ad7d835a7ab2e19da3903453587bc0c47aa9b483f3989c9db1a5eeb0febb77","observation_id":"d5bd4a5b-0163-4bf4-8052-2839630a70dc","resolution":{"observed_at":"2026-08-07T14:56:41.529877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:52.096873Z","title":"K., & Patra, B","venue":null,"work_id":"c49bbdb0-0ee3-4629-ab64-8c604d6806d4","year":2023},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.618807Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:a2b078b0d646f0fa8768b560e35bc9d99b1e51647d05dda048067726d215e71b","observation_id":"1f70bd03-c8ea-47fa-9067-88fc3f01d8a4","resolution":{"observed_at":"2026-08-07T14:56:52.194389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:51.790470Z","title":"B., Panda, D., Mishra, T","venue":null,"work_id":"46034984-7b54-49a8-9ab8-40251eb8cb16","year":2024},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.707611Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:d56858b3526e3946546eb908dc35a67e6a7ba446e564f26ae0a096c98eb96dc1","observation_id":"4ef9b725-680d-4f7a-a34d-beb3d2db41b6","resolution":{"observed_at":"2026-08-07T14:56:51.927502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:51.494689Z","title":"B., Biradar, A., Mishra, T","venue":null,"work_id":"40be723e-ee6d-44c2-b1e2-928a7ce7ef21","year":2022},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.803355Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:484ffcc1bf02c30fe6482c597a46e57b41c4a9cef02c1f202e0013ec39183f1b","observation_id":"551d8edb-cb64-4d4c-b150-1f71133c0996","resolution":{"observed_at":"2026-08-07T14:56:51.655445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.08144","last_updated":"2016-10-08T19:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-26T19:59:55Z","title":"Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08144","snapshot_observed_at":"2026-08-07T14:56:41.907403Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.907403Z"},"links":{"cited_paper":"/paper/1609.08144","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:7b36304be0afab60b81aa67235f7f3d030329c74c1a0d44f77081646924b3c9a","observation_id":"1afd84be-9fb9-4b5d-9950-761ae9f6e73a","resolution":{"observed_at":"2026-08-07T14:56:41.907403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:51.208423Z","title":null,"venue":null,"work_id":"535061e0-9e99-46f1-a5bf-a4b331d9681e","year":1990},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.987662Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:ad4f220b49e76d32cfacf8b01e66827f286953a587bc00b6af78792f23291ab9","observation_id":"49cb7729-eb5b-446c-831a-5860104c1ea3","resolution":{"observed_at":"2026-08-07T14:56:51.339239Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:50.989710Z","title":null,"venue":null,"work_id":"ed44857a-0e22-4af2-bb2c-b36b3bf39807","year":2011},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:42.083468Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:941cf72f6f13883e47d7ebf3747f7a9c92cc4ca62304ac673ad07e6e576a0ae4","observation_id":"9dc1623c-3682-40d0-a077-31310bb4604f","resolution":{"observed_at":"2026-08-07T14:56:51.076132Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:50.744057Z","title":"Statistical machine translation","venue":null,"work_id":"5a9ff7d7-e838-4bb1-b532-7964909986d7","year":2008},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:42.166468Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:09942c8af33ef7b1f8a2fb898f9965f2c3c110b11b61a971a1da6fdfbdfebadf","observation_id":"69713da9-d7fc-4d45-9cc8-78893e6d380e","resolution":{"observed_at":"2026-08-07T14:56:50.872502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-07-06T03:53:10.336430Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-07T14:56:42.262089Z","title":"Neural machine translation by jointly learning to align and translate","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:42.262089Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:932674f607227f78e75297ab2df6397d2c6a884d1952a73edfc413ac95cfa3f3","observation_id":"3bc8e54e-839f-4145-94cc-aecdce8c0b3f","resolution":{"observed_at":"2026-08-07T14:56:42.262089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:50.460303Z","title":null,"venue":null,"work_id":"495f1943-abe3-4cc4-af29-a9206922a568","year":2017},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:42.366538Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:d47c52126bfc210d4bcc9212fcca953196e5c349dc42bfcc98ddbc5ba696fb42","observation_id":"d9debab4-e691-4772-88d1-ae86f1796e02","resolution":{"observed_at":"2026-08-07T14:56:50.602641Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.00089","last_updated":"2019-07-02T16:44:03Z","snapshot_observed_at":"2026-08-08T09:58:12.452888Z","submitted_at":"2019-02-28T22:26:12Z","title":"Massively Multilingual Neural Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.00089","snapshot_observed_at":"2026-08-07T14:56:42.479881Z","title":"Massively multilingual neural machine translation","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:42.479881Z"},"links":{"cited_paper":"/paper/1903.00089","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:97ccfe0b679a1fb8652ce5b0e1a6b7cede697d74d02ff5e3ec94e5d1d930e284","observation_id":"1606030e-d832-4f04-ac59-f19e4594868e","resolution":{"observed_at":"2026-08-07T14:56:42.479881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:50.219317Z","title":null,"venue":null,"work_id":"d35ae430-d975-4f70-a989-cde4789f514f","year":2019},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:42.572397Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:d05e4c760b103dbee09f826c7c2ae3ed249ad73b77b22c62ebbfbaafa0b7288f","observation_id":"f6626084-c8ea-48df-9bdd-a08cb8a77682","resolution":{"observed_at":"2026-08-07T14:56:50.349360Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06226","last_updated":"2018-08-19T16:49:06Z","snapshot_observed_at":"2026-07-06T06:56:20.935388Z","submitted_at":"2018-08-19T16:49:06Z","title":"SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06226","snapshot_observed_at":"2026-08-07T14:56:42.668489Z","title":"Sentencepiece: A simple and language independent subword tokenizer and detokenizer for neural text processing","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:42.668489Z"},"links":{"cited_paper":"/paper/1808.06226","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:9f33eb39aabff91fd836e2d4b3215052967cbd647f70ec7a4ea471226259c325","observation_id":"b1c26973-80a4-4afe-bd67-e6ecc1701507","resolution":{"observed_at":"2026-08-07T14:56:42.668489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.04290","last_updated":"2017-01-16T13:55:01Z","snapshot_observed_at":"2026-07-06T05:26:19.801141Z","submitted_at":"2017-01-16T13:55:01Z","title":"Machine Translation Approaches and Survey for Indian Languages","version":1},"cited_work":{"arxiv_id":"1701.04290","doi":null,"metadata_source":"pith","pith_arxiv_id":"1701.04290","snapshot_observed_at":"2026-08-07T14:56:46.483687Z","title":"Machine Translation Approaches and Survey for Indian Languages","venue":"cs.CL","work_id":"9c4b0b22-57c0-4d8e-b441-e497eb90b426","year":2017},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:42.801331Z"},"links":{"cited_paper":"/paper/1701.04290","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:8c2a8996ee867acaa002b6aca832357796c33cba18ecb96bf37e5b92a9a66817","observation_id":"ba047e57-4187-44eb-8d9a-ebeefb80b38f","resolution":{"observed_at":"2026-08-07T14:56:46.539097Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:49.968282Z","title":null,"venue":null,"work_id":"4f364289-1441-42a2-934e-11bf1852792b","year":2023},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:42.917746Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:3d890aa7c9d832a995d982b5af8d20fc4a705f7cb8b3693fbe3d821aea650198","observation_id":"d6f7ee31-1969-458a-9ec1-855f6315827b","resolution":{"observed_at":"2026-08-07T14:56:50.100829Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:49.767202Z","title":"Morphology: Indian languages and European languages","venue":null,"work_id":"ee2da297-7ff5-432f-8855-bc7aa38cb3dd","year":2013},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:43.049181Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:be76651d7bb983e216f2e60d8f2df3844b8b2bed4aaeafc972d0bb3dafbe6401","observation_id":"9fcba593-8f1d-4005-ac65-798d9aa798f5","resolution":{"observed_at":"2026-08-07T14:56:49.850961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15524","last_updated":"2021-10-05T22:18:32Z","snapshot_observed_at":"2026-08-06T22:19:44.625305Z","submitted_at":"2020-12-31T10:01:29Z","title":"Fast WordPiece Tokenization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15524","snapshot_observed_at":"2026-08-07T14:56:43.166127Z","title":"Fast wordpiece tokenization","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:43.166127Z"},"links":{"cited_paper":"/paper/2012.15524","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:e3cd6e6932925a9a5e107a95d085c839777e28ac193cbeb1248626ebe86cac64","observation_id":"17b62402-c801-424e-a09b-fefe4788404e","resolution":{"observed_at":"2026-08-07T14:56:43.166127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:49.516296Z","title":"NLTK documentation","venue":null,"work_id":"83b831e2-89a5-44a4-a4ee-0ac2ccb9252e","year":2008},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:43.332058Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:1ce8f83efbb89cc01ed1e445f17447e0efbbcc2b5abd0bb43dcd0e15e4cf4fd3","observation_id":"2edf3d60-c5b2-4672-90bd-c34226b1aa9b","resolution":{"observed_at":"2026-08-07T14:56:49.659129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:49.279578Z","title":"D., Tetreault, J., & Stent, A","venue":null,"work_id":"af5ea136-8eac-4e74-96c4-35cde145d363","year":2015},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:43.492695Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:8b7d26596b2ea67fc29ffa04e64d1dcb96547c24f3dee9858e6630bccc0fb298","observation_id":"24fd864b-8ebd-421d-bc1b-768dec29dbe0","resolution":{"observed_at":"2026-08-07T14:56:49.424184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10508","last_updated":"2021-12-20T13:04:18Z","snapshot_observed_at":"2026-07-06T12:20:36.165718Z","submitted_at":"2021-12-20T13:04:18Z","title":"Between words and characters: A Brief History of Open-Vocabulary Modeling and Tokenization in NLP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10508","snapshot_observed_at":"2026-08-07T14:56:43.616119Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:43.616119Z"},"links":{"cited_paper":"/paper/2112.10508","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:bcf0540d9cb7c5c26b8cf74667d61b40e3c1c21cf2b444ed5cf569b33bef5811","observation_id":"4f013cee-8e99-4990-b05f-77b42f49ad0b","resolution":{"observed_at":"2026-08-07T14:56:43.616119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.04586","last_updated":"2015-11-14T17:36:43Z","snapshot_observed_at":"2026-08-10T10:22:55.632596Z","submitted_at":"2015-11-14T17:36:43Z","title":"Character-based Neural Machine Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.04586","snapshot_observed_at":"2026-08-07T14:56:43.749854Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:43.749854Z"},"links":{"cited_paper":"/paper/1511.04586","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:6b4cdee0d7c3260928abf57852d66f3f99aea3eb1cf3c1a1f352c4af4c36c433","observation_id":"30e5eb63-3725-4b29-b9a2-43d52bfbc586","resolution":{"observed_at":"2026-08-07T14:56:43.749854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02534","last_updated":"2020-10-06T07:20:41Z","snapshot_observed_at":"2026-08-10T06:27:08.172064Z","submitted_at":"2020-10-06T07:20:41Z","title":"An Empirical Study of Tokenization Strategies for Various Korean NLP Tasks","version":1},"cited_work":{"arxiv_id":"2010.02534","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.02534","snapshot_observed_at":"2026-08-07T14:56:46.274565Z","title":"An Empirical Study of Tokenization Strategies for Various Korean NLP Tasks","venue":"cs.CL","work_id":"ee75cd2d-f871-442c-bb91-de98f50f0922","year":2020},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:43.850716Z"},"links":{"cited_paper":"/paper/2010.02534","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:118a8098809cfd3dd3365f24997262cf05ee625025ab97a744f0f020c25653e0","observation_id":"7a1c699a-9b42-4830-9f31-bba3923be6ca","resolution":{"observed_at":"2026-08-07T14:56:46.375650Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.13267","last_updated":"2020-05-01T18:54:20Z","snapshot_observed_at":"2026-08-02T07:25:01.310491Z","submitted_at":"2019-10-29T13:42:56Z","title":"BPE-Dropout: Simple and Effective Subword Regularization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.13267","snapshot_observed_at":"2026-08-07T14:56:44.126108Z","title":"BPE -dropout: Simple and effective subword regularization","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:44.126108Z"},"links":{"cited_paper":"/paper/1910.13267","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:a46c4137a2321242c9711dfb973d8e0430e40d993a325bf47a3053174aa1e378","observation_id":"299d4fb3-4312-4b58-bcb0-72b75f872f79","resolution":{"observed_at":"2026-08-07T14:56:44.126108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.03720","last_updated":"2020-10-05T17:35:44Z","snapshot_observed_at":"2026-07-06T09:10:48.901105Z","submitted_at":"2020-04-07T21:21:06Z","title":"Byte Pair Encoding is Suboptimal for Language Model Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.03720","snapshot_observed_at":"2026-08-07T14:56:44.277726Z","title":"Byte pair encoding is suboptimal for language model pretraining","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:44.277726Z"},"links":{"cited_paper":"/paper/2004.03720","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:48c97e5dba61ddfc42e1b00f27cf29d7def33c1516c52b3e31074f5b3f02a1e4","observation_id":"2354ad57-c2db-4543-93a7-5f74cd55ecca","resolution":{"observed_at":"2026-08-07T14:56:44.277726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07349","last_updated":"2022-03-08T11:52:08Z","snapshot_observed_at":"2026-07-06T11:19:00.383610Z","submitted_at":"2021-06-01T15:17:45Z","title":"Using Integrated Gradients and Constituency Parse Trees to explain Linguistic Acceptability learnt by BERT","version":2},"cited_work":{"arxiv_id":"2106.07349","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.07349","snapshot_observed_at":"2026-08-07T14:56:46.067062Z","title":"Using Integrated Gradients and Constituency Parse Trees to explain Linguistic Acceptability learnt by BERT","venue":"cs.CL","work_id":"b8906b3a-060b-48e5-b8e0-e4035e1ff0a0","year":2021},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:44.384852Z"},"links":{"cited_paper":"/paper/2106.07349","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:8a2ea7917b48e6393ee2aa90690b8eb41c59c684d231abe896bbc0ebe23fd0f9","observation_id":"13c3f9df-408b-40e9-a3e0-c357cbb5ea39","resolution":{"observed_at":"2026-08-07T14:56:46.136522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:49.091246Z","title":"HAN: hierarchical association network for computing semantic relatedness","venue":null,"work_id":"44a9029f-a86e-45e4-9e5a-784392288f27","year":2018},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:44.559715Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:6a15741bfb04ea7b425feb2169a7d17411de804e86637ac32d7908e7b8a40315","observation_id":"8aa51c85-b120-41dd-bf41-a894350007cd","resolution":{"observed_at":"2026-08-07T14:56:49.182855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:48.871062Z","title":"Meaningless yet meaningful: Morphology grounded subword- level NMT","venue":null,"work_id":"5a2bec71-f8df-4da4-8145-2a99117f95cc","year":2018},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:44.716253Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:bf050186cfbcfaa267f7bc7a158c57a712767e6bee802f660460542f710f11f7","observation_id":"afe603d7-9c9b-432d-bd6d-c39ba4577c88","resolution":{"observed_at":"2026-08-07T14:56:48.952378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:48.626005Z","title":null,"venue":null,"work_id":"0996d128-fa5a-44c8-9b9d-9ac74e80efaa","year":null},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:44.805572Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:3cf828c09585c2748f709b14d0bbefba64561ec0f721a55d2bf1e34e9baf1974","observation_id":"73ad5378-3fce-4a90-b788-46f1acddc5e2","resolution":{"observed_at":"2026-08-07T14:56:48.737339Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T14:56:44.948945Z","title":"W., Lee, K., & Toutanova, K","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:44.948945Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:d5a8c2d3ca3cb2518d626200567deb990b5e5a5b13b36d20c9815bdbf018a43c","observation_id":"6b3376c9-85a7-4743-917c-d9eeb2bbc44e","resolution":{"observed_at":"2026-08-07T14:56:44.948945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:48.450220Z","title":"AI as the next GPT: a Political -Economy Perspective","venue":null,"work_id":"63c2432a-3585-43a0-8299-161a865b6732","year":2018},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:45.049589Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:1735917ccb4bd761eb846a944f7d7d173bda862c520fb8c5b4938ad6c131662c","observation_id":"fa1e4781-9d82-4b9a-bd61-c3bb47ad0cab","resolution":{"observed_at":"2026-08-07T14:56:48.544357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:48.242881Z","title":null,"venue":null,"work_id":"88ab24ae-3beb-4d4f-babd-efd5609d71c0","year":2017},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:45.152504Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:193939c5abcf1e06e1e4467b8a7d707f1a00a109fe92a65e3ddf577842555fad","observation_id":"5da2293b-5724-472f-a723-ab5bc8ff582d","resolution":{"observed_at":"2026-08-07T14:56:48.346280Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.01038","last_updated":"2019-04-01T18:05:02Z","snapshot_observed_at":"2026-08-06T00:26:50.886840Z","submitted_at":"2019-04-01T18:05:02Z","title":"fairseq: A Fast, Extensible Toolkit for Sequence Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.01038","snapshot_observed_at":"2026-08-07T14:56:45.244129Z","title":null,"venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:45.244129Z"},"links":{"cited_paper":"/paper/1904.01038","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:175cc105d94254e3af3e55d36716d52d1f8f8ff8c8bce5489c5bcd0e02c0b17c","observation_id":"f6f2050a-1697-458d-b091-17fafffa61ad","resolution":{"observed_at":"2026-08-07T14:56:45.244129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:47.991388Z","title":null,"venue":null,"work_id":"105b4c56-99cc-49c2-919c-e3c1db97d685","year":2020},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:45.360960Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:0e19f96050c2d1255588482528b8688969d159384cfd82fc845e314073e9205a","observation_id":"e8ee23cc-5c85-42ad-8818-fc4235c0b593","resolution":{"observed_at":"2026-08-07T14:56:48.099408Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:47.680458Z","title":null,"venue":null,"work_id":"79d6c659-4623-4844-a4b7-219bcbe5017f","year":2007},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:45.437018Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:8184073d7505af1a997d871ae78fb7967eaf9cc8514a3c809738cb2a7f1ca106","observation_id":"6914086e-43ac-4199-9df7-1636f4fdc64b","resolution":{"observed_at":"2026-08-07T14:56:47.821428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:47.444470Z","title":"Moses-Statistical Machine Translation System","venue":null,"work_id":"49b77e1d-f0db-4dc8-a56c-f49ff5bb8c31","year":2010},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:45.548671Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:c147d6239de65b089d65d27bdb14b36e4a931267906dee7f6bb7785f306aa50d","observation_id":"717053e7-a5b4-48d7-9fce-a8e9a5f59f03","resolution":{"observed_at":"2026-08-07T14:56:47.538867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T14:56:45.645407Z","title":"P ., & Ba, J","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:45.645407Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:6df96af1249e212de2121da88551a0f488ab41cd1e7d1dd6a3208f24d7ba1c62","observation_id":"1bf3a788-d361-49cf-be01-6b13ca1437e3","resolution":{"observed_at":"2026-08-07T14:56:45.645407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:47.257881Z","title":"Post, A call for clarity in reporting BLEU scores, in Proceedings of the Third Conference on Machine Translation: Research Papers","venue":null,"work_id":"ecf08c65-c611-45a7-ad51-39ef3aa50153","year":2018},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:45.739641Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:59121c4a56c5580bc9eac14f7393f26be5c33798f57290cfb131b1c8c3c6ff21","observation_id":"68133417-a204-4aac-a1cf-e6726cb1a396","resolution":{"observed_at":"2026-08-07T14:56:47.359452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:46.933357Z","title":null,"venue":null,"work_id":"305b4979-7365-49fa-8a20-85d687cfc62b","year":2020},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:45.830297Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:2a246a87d783bd2f0b418e6f530fb04141507a7dd94d381604b715a5c928d84a","observation_id":"a80c834e-7b5d-484e-8ecf-b16e383ec87a","resolution":{"observed_at":"2026-08-07T14:56:47.089618Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:46.728943Z","title":"B., Choudhury, S., Mishra, T","venue":null,"work_id":"33d79738-90fb-4c73-b842-6184f4f10156","year":2025},"citing_paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:45.919746Z"},"links":{"citing_paper":"/paper/2505.16868"},"observation_digest":"sha256:90338e3abe0e578ad26e959a2792f129a4955b038df7d91a80b45216c6c9087e","observation_id":"fff5327f-622b-4c4d-8999-9b0fc0d45680","resolution":{"observed_at":"2026-08-07T14:56:46.811586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16868","last_updated":"2025-05-22T16:24:37Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T14:51:41.178935Z","submitted_at":"2025-05-22T16:24:37Z","title":"Comparative analysis of subword tokenization approaches for Indian languages"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":27,"verified_exact":2,"verified_fuzzy":17},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2505.16868."}