{"as_of":"2026-08-09T17:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9a7042d78855edf64bd1628e3376353cd0d1f9702fc93969ecf56193335b004f","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:43:22.479627Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.07572/citation-record","integrity":"/paper/2507.07572/integrity","json":"/paper/2507.07572/citation-record.json","paper":"/paper/2507.07572"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:26.606027Z","title":null,"venue":null,"work_id":"882f1f20-98ad-4f03-83e0-a4794e8ac8c8","year":2024},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:17.249393Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:ea4e09acf55197718dca13b1170aba75f0a764c7af04e89199fa9c3b65e74bea","observation_id":"6dc2b321-d1db-4656-a462-9264db353127","resolution":{"observed_at":"2026-08-06T18:43:26.658679Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:17.359819Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:17.359819Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:4b3c0a6b7b080232a0d67b80668ae154ad712d14aec35beed8d3be04b1a09f69","observation_id":"bdac6906-0ab9-460a-9edc-43e17dc20641","resolution":{"observed_at":"2026-08-06T18:43:17.359819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:26.386201Z","title":null,"venue":null,"work_id":"dd79a206-5ea5-406d-8f63-82e3ff1294bc","year":2021},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:17.469102Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:b5ccee0728ea006cff055d77df872c2eb14a9b546c8f0366fa31b3afd0841512","observation_id":"6b6fbd1a-17e0-4ea4-b980-901eb30e7fd4","resolution":{"observed_at":"2026-08-06T18:43:26.482077Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12895","last_updated":"2024-03-19T16:48:40Z","snapshot_observed_at":"2026-08-07T02:52:27.054968Z","submitted_at":"2024-03-19T16:48:40Z","title":"mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12895","snapshot_observed_at":"2026-08-06T18:43:17.602697Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:17.602697Z"},"links":{"cited_paper":"/paper/2403.12895","citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:3d3a00116c36e9547b92956939e84ed3b2365c2b48533a600bd6c7b9406a5aa8","observation_id":"310cdb34-bc96-4d48-ab61-5808c1d8a2b8","resolution":{"observed_at":"2026-08-06T18:43:17.602697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:17.696528Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen - Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:17.696528Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:1a75e3044f6cb625d9fc899e5e6f640320c0c6d46a5f1e0695ed3442119a3644","observation_id":"2296abb2-4e8f-4392-8606-0a28df6bc9e0","resolution":{"observed_at":"2026-08-06T18:43:17.696528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T18:43:17.801670Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:17.801670Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:7d2664cde8a6ee5daaad73db8d92a7d5805db6ac6f302af47d0edc2c87f37846","observation_id":"1bc7f4d3-af09-475e-99da-44cf5e6753ad","resolution":{"observed_at":"2026-08-06T18:43:17.801670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:26.126086Z","title":null,"venue":null,"work_id":"e61e265a-c4e1-4313-a18b-5418e9e56bb1","year":2021},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:17.884482Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:51dc640dc23184104a463c711bb4ca8f58b3fe140333fb204b542361c42d1703","observation_id":"a6de0343-f519-4e49-9730-79ccf97b7b90","resolution":{"observed_at":"2026-08-06T18:43:26.260103Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:17.981814Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:17.981814Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:9181afbab3aef22a953fb213d65b1ed9ceebc60dcbff13eec69b606cfcb93cbf","observation_id":"57d06870-3a37-42ac-92e3-6f8c3c6c4e6b","resolution":{"observed_at":"2026-08-06T18:43:17.981814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02894","last_updated":"2024-07-03T08:15:39Z","snapshot_observed_at":"2026-07-06T18:40:48.783743Z","submitted_at":"2024-07-03T08:15:39Z","title":"Translatotron-V(ison): An End-to-End Model for In-Image Machine Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02894","snapshot_observed_at":"2026-08-06T18:43:18.134593Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:18.134593Z"},"links":{"cited_paper":"/paper/2407.02894","citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:0772a3f19f349604edbf58f6fd1c0fc00f2e4f9bbfabea85b3889e56230e5efb","observation_id":"c926d771-bc43-425c-b240-5862a28ee999","resolution":{"observed_at":"2026-08-06T18:43:18.134593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:18.232927Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:18.232927Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:a7748494f6f160797d3b8a79306e9b79e888eff056d99f5826a8ab2d414d49bc","observation_id":"09771ffe-fd32-4820-bab3-4bfadea98e0c","resolution":{"observed_at":"2026-08-06T18:43:18.232927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:18.318402Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:18.318402Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:44ecd00a40fb3aee49733cf5f039681533cedc70e02563954e6cc575ff5aaadf","observation_id":"0979d8c0-a23b-4506-9f84-d6c4531577fa","resolution":{"observed_at":"2026-08-06T18:43:18.318402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:18.448305Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:18.448305Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:0b86cbc383da5f21ef8720d8a913911920668d6a4319f0896623113fdacc69cd","observation_id":"d9374080-267b-459d-bd30-5ce2bfe06085","resolution":{"observed_at":"2026-08-06T18:43:18.448305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:25.894952Z","title":null,"venue":null,"work_id":"40b0d225-fb96-4cb9-acc8-cba788c396fd","year":2023},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:18.549315Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:d262e562254ecbc32ffc1aa427a14fc79365dadf221a0b92c720284ee5fde4c9","observation_id":"621e9192-ad72-48e2-b972-2c2d8ac597bf","resolution":{"observed_at":"2026-08-06T18:43:26.008068Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-04T10:28:00.554323Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-08-06T18:43:18.671551Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:18.671551Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:38e66401452e1e47050ee4fb8b693dd8379eb83f6c4480c8c1275cae880c999b","observation_id":"836f1d85-7cb8-4389-ad5a-7a2d6669fde8","resolution":{"observed_at":"2026-08-06T18:43:18.671551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:25.620369Z","title":null,"venue":null,"work_id":"38d22a3b-36fb-441e-822f-512fe16e3f83","year":2023},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:18.799322Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:dcf833d87cf8816a1e41a1079835ad3d227116088157a97300e540335b3cfb2c","observation_id":"08f09daf-7f9c-4d6a-a3e0-a912c63669aa","resolution":{"observed_at":"2026-08-06T18:43:25.745811Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:25.397933Z","title":null,"venue":null,"work_id":"960005c6-3e45-4daa-b00c-16142ee6d7bc","year":2022},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:18.940501Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:e600d7942f45c3e1c071a2d85779760d43bb6c62b5516547443ba2e339bce52e","observation_id":"47b5cf15-cab5-4aea-8a21-edace5787eef","resolution":{"observed_at":"2026-08-06T18:43:25.474343Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:25.123149Z","title":null,"venue":null,"work_id":"fc7ec7ba-097f-4a22-97f5-28b5d72bf855","year":2023},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:19.091972Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:eb440003e952850049fb3da84c9c736f33f88af919ace422b3bf77810d3c2839","observation_id":"cc494ea0-9e09-496f-a697-4a3da22fc6d6","resolution":{"observed_at":"2026-08-06T18:43:25.237937Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:24.926262Z","title":null,"venue":null,"work_id":"c4879b2e-a3af-49d1-a31e-e310bcae25d1","year":2023},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:19.200333Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:457fa1864955cee30f8b526ea773592142fe0f29f906de7d1536256080339c1e","observation_id":"44ea4592-9e4c-4f04-aaa2-1f04274590ca","resolution":{"observed_at":"2026-08-06T18:43:25.037978Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:24.741875Z","title":null,"venue":null,"work_id":"a8fd3083-3e3d-49e2-9b0f-e6535642d848","year":2024},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:19.326929Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:69f72c1a56b0231623a76dc92b3754ba8c69582325ddcf4447c299d77b82485e","observation_id":"d2fe24c6-c3e2-4f60-8151-cb5b13f1c0f6","resolution":{"observed_at":"2026-08-06T18:43:24.826273Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:24.559943Z","title":null,"venue":null,"work_id":"60e29549-dda7-4356-9f8d-0a0b7f158dc0","year":2024},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:19.431700Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:b694797cac3fc08230a74412fc3dd265f369b39c8eaac866c6f2c1ecf4ac8802","observation_id":"3b055af7-2b40-4165-8088-e074e9d6d084","resolution":{"observed_at":"2026-08-06T18:43:24.622945Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:19.562389Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:19.562389Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:3554b6f0e000623dd7833ff9b67f7aefcbc7cb11e3d744838a5a5e95a3ffc5bf","observation_id":"eb7ea040-f597-4173-a005-0e4d8149a5b0","resolution":{"observed_at":"2026-08-06T18:43:19.562389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11432","last_updated":"2024-06-17T11:37:48Z","snapshot_observed_at":"2026-08-09T17:46:32.953063Z","submitted_at":"2024-06-17T11:37:48Z","title":"AnyTrans: Translate AnyText in the Image with Large Scale Models","version":1},"cited_work":{"arxiv_id":"2406.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.11432","snapshot_observed_at":"2026-08-06T18:43:23.721564Z","title":"AnyTrans: Translate AnyText in the Image with Large Scale Models","venue":"cs.CV","work_id":"2778af10-3810-49db-987f-b00ce0f52e52","year":2024},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:19.689068Z"},"links":{"cited_paper":"/paper/2406.11432","citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:8a7cadc9ff40d642707b763359bcad6dd1c395dcf0a89eb4442de829761ed3d7","observation_id":"87267277-c07d-4b20-82c3-e49eaf6d0c0b","resolution":{"observed_at":"2026-08-06T18:43:23.803754Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:19.833230Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:19.833230Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:2b755bc3dba1051df7a1c62383fe4d4d262aa849dffbef20f24b056516f65038","observation_id":"6fc84834-7f6a-4097-a237-80af945b0015","resolution":{"observed_at":"2026-08-06T18:43:19.833230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:19.980256Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:19.980256Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:48825a280f44d94413b2cb815830eb0e37d84ca8b6eb8a842330904fec3217a8","observation_id":"661ee238-238a-4928-9db6-02a159c7b0e6","resolution":{"observed_at":"2026-08-06T18:43:19.980256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.emnlp-demo.22","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:22.956669Z","title":null,"venue":null,"work_id":"6e57ce40-a4ea-45ab-9d1f-445b12ff126e","year":2023},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:20.103767Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:762f9fc683614ace2af7bab75d2b3bb702d2ac4015d2f59eb30ee47d45e19119","observation_id":"f6083f23-d158-4533-91f5-b857296d4947","resolution":{"observed_at":"2026-08-06T18:43:23.094847Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T18:43:20.209416Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:20.209416Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:be4c519ee99dc9a4f0cffd59c8472aa193ec4a0fbcada77cb2d05715a17c9372","observation_id":"e7b7882e-a38a-49d7-a955-15442eb3ed0a","resolution":{"observed_at":"2026-08-06T18:43:20.209416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:20.306704Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:20.306704Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:b6ee3391adfd67530cc8379f5d0e2b2bd39b3548541fa592f4d8c315b33ea1a7","observation_id":"e2d68b63-7cb2-41a2-8ee1-57cc5bf0ac6a","resolution":{"observed_at":"2026-08-06T18:43:20.306704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:20.441635Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:20.441635Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:f2389cbebb7a35ff54267169ac19e0cb33ca0a90f50b9d3e690e57ed2971fe9f","observation_id":"47265098-39ea-48f1-a157-bd79d7ede202","resolution":{"observed_at":"2026-08-06T18:43:20.441635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-07-06T16:59:36.461335Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-08-06T18:43:20.589681Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:20.589681Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:e58dced30d9c28c115e27b13e95f7e48e625804ba62fee985b7d9ff8e49089b7","observation_id":"367341b0-89e6-42f2-b246-9aedb38f19ec","resolution":{"observed_at":"2026-08-06T18:43:20.589681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12503","last_updated":"2024-01-23T05:55:26Z","snapshot_observed_at":"2026-08-06T03:32:53.706719Z","submitted_at":"2024-01-23T05:55:26Z","title":"Small Language Model Meets with Reinforced Vision Vocabulary","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12503","snapshot_observed_at":"2026-08-06T18:43:20.711870Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:20.711870Z"},"links":{"cited_paper":"/paper/2401.12503","citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:7d1cf70f5706a0a9dab48be9557bd6ef7a5b54b055c8307f540c766ed42608ac","observation_id":"b8c558e9-a200-4c3d-994c-2ab58b37d8ff","resolution":{"observed_at":"2026-08-06T18:43:20.711870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-06T18:43:20.849724Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:20.849724Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:793061ea117b75d6bde1e7bc4c58d58cf08d86a8ff90deed378d8f491b562814","observation_id":"b3366063-80bd-4a49-a4b4-65b52d237c8e","resolution":{"observed_at":"2026-08-06T18:43:20.849724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12430","last_updated":"2023-10-19T02:49:09Z","snapshot_observed_at":"2026-08-06T05:31:08.197424Z","submitted_at":"2023-10-19T02:49:09Z","title":"DocXChain: A Powerful Open-Source Toolchain for Document Parsing and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12430","snapshot_observed_at":"2026-08-06T18:43:20.970551Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:20.970551Z"},"links":{"cited_paper":"/paper/2310.12430","citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:02b2b24f6922ef04c174ef437e3024f90cff061fef8108bb9304484850e1ddd1","observation_id":"b54d8299-b8f4-4942-8f0c-e52353333fd5","resolution":{"observed_at":"2026-08-06T18:43:20.970551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02499","last_updated":"2023-07-04T11:28:07Z","snapshot_observed_at":"2026-08-01T15:24:02.956161Z","submitted_at":"2023-07-04T11:28:07Z","title":"mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02499","snapshot_observed_at":"2026-08-06T18:43:21.088382Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:21.088382Z"},"links":{"cited_paper":"/paper/2307.02499","citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:295bfa2dce033c44703c72139d26b26e5a89a83a8ab46cb26558001a01c2ee82","observation_id":"4b668490-1497-4a9e-ba9e-36a94dd2cd0e","resolution":{"observed_at":"2026-08-06T18:43:21.088382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09204","last_updated":"2024-04-14T09:48:37Z","snapshot_observed_at":"2026-08-01T15:08:25.999360Z","submitted_at":"2024-04-14T09:48:37Z","title":"TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09204","snapshot_observed_at":"2026-08-06T18:43:21.184881Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:21.184881Z"},"links":{"cited_paper":"/paper/2404.09204","citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:de3d68a54800a6accc5cc1bb63716b8a1802cff777ab7b30e944dc728ffe765b","observation_id":"da945551-70eb-4509-a555-6964945401cb","resolution":{"observed_at":"2026-08-06T18:43:21.184881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-06T18:43:21.283146Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:21.283146Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:dc4cdc42e6c4145ca219c60461f8383800e433d8e7c2177c53b5027eebfd9027","observation_id":"568769e4-9114-4bd8-9e2e-fe8d9b7c8914","resolution":{"observed_at":"2026-08-06T18:43:21.283146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:21.438277Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:21.438277Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:d7b33a25c2656dd142afb84c57e32968d330c56209eab5b5e020065dcdd6079d","observation_id":"058aca8d-a209-44e2-9cf3-80997d90c1c4","resolution":{"observed_at":"2026-08-06T18:43:21.438277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:21.583194Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:21.583194Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:09775a5fd15270be33e5b0fd934e41c75de0da8640af192d0254db9e6087dc84","observation_id":"927e280a-4c4d-4dbc-b4d8-860dd826acea","resolution":{"observed_at":"2026-08-06T18:43:21.583194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:24.293087Z","title":null,"venue":null,"work_id":"b528b290-10ff-40d5-836c-6e577a23733b","year":2025},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:21.691780Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:439b2467f661134517cfbc00d3806b642ad13f31c1641b5a7a5daebe4b13b314","observation_id":"b14c7078-59e3-485b-a49c-2be46bcfabc7","resolution":{"observed_at":"2026-08-06T18:43:24.372435Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:21.831772Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:21.831772Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:6cc58032ff2f75e1848ae4440bcbd0ce06df7cf057e1db9fddae99e0d61ebbe4","observation_id":"23791114-4098-49e3-a17c-314ea538591d","resolution":{"observed_at":"2026-08-06T18:43:21.831772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:21.995958Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:21.995958Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:dfdc4f77692ea65e1bc04f1c6b2dea5ae7ab53d94d6ff88ef6009c0806199344","observation_id":"5a7ff8e7-e621-4895-8db6-0127cb835b59","resolution":{"observed_at":"2026-08-06T18:43:21.995958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.naacl-long.465","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:22.645496Z","title":null,"venue":null,"work_id":"334f6deb-94b3-4e2b-9650-680b8124300f","year":2024},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:22.110184Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:3779c6dddf025d173ef71bfd791a08ebc7e86771356d2170e1db856ef8c5ef83","observation_id":"31d7ac5b-3258-4d07-a4fd-5570c973ddad","resolution":{"observed_at":"2026-08-06T18:43:22.757552Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:24.081200Z","title":null,"venue":null,"work_id":"243ca1f3-848a-490e-b25c-286a0cf724f4","year":2016},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:22.209834Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:d5334c22ab167b66e652fbf84042c6fa5ba2cffb90402cf07b77d1c819066764","observation_id":"4f85e258-13dc-4932-9cd9-69d55e67015d","resolution":{"observed_at":"2026-08-06T18:43:24.144624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:22.339252Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:22.339252Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:15ecf76ef7b392d7cef09cda9a5ed9cc838fc98582c473c818cf0927b91a3aa9","observation_id":"3c75423e-e542-4227-9811-01443ea5758c","resolution":{"observed_at":"2026-08-06T18:43:22.339252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:22.479627Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:22.479627Z"},"links":{"citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:772f496cd949636f50642d8d6581d6b94003fd4fd1dd1a25a02bf6bd3f0856ae","observation_id":"9db02041-8bfc-4c1a-8e66-e438ae89158e","resolution":{"observed_at":"2026-08-06T18:43:22.479627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2507.07572."}