{"as_of":"2026-08-17T08:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1873e5d25edbc44ef1cdf72e522dd9c9d270e86b5792f664b9724a1874e03d3b","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:47:47.562309Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.17315/citation-record","integrity":"/paper/2504.17315/integrity","json":"/paper/2504.17315/citation-record.json","paper":"/paper/2504.17315"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:47.975670Z","title":"LayoutDIT: Layout-aware end-to-end document image translation with multi-step conductive decoder[C]//Findings of the Associa- tion for Computational Linguistics: EMNLP 2023","venue":null,"work_id":"43d96de9-093c-4d43-8b74-c73cdad2c57b","year":2023},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.447418Z"},"links":{"citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:5e479867d04a0552f1f96ca823f8859d740dff47e6ea40f64a2dda863202a431","observation_id":"f45c9075-195d-4c54-89cf-42b4ed02a5af","resolution":{"observed_at":"2026-08-16T10:47:47.980404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:47.961517Z","title":null,"venue":null,"work_id":"1b003e98-160c-441c-b75d-e70b28f15bb0","year":2024},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.452703Z"},"links":{"citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:6b8f65375a794e69ec30e02aad5fc98dff562652949b8db765b2b8fd833e16bb","observation_id":"e4155984-a997-4684-979b-d3dad6273107","resolution":{"observed_at":"2026-08-16T10:47:47.965980Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:47.946382Z","title":"Document Image Analysis for Text Extraction and Trans- lation","venue":null,"work_id":"c7f87beb-17d2-44a3-a472-a3eb9468da24","year":2023},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.456905Z"},"links":{"citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:878724da41a9323c1d3e24d85bfcc1404ac2cea0101605c24f1c91f37a5304de","observation_id":"825a9231-da36-49e8-a801-4d6f47f70022","resolution":{"observed_at":"2026-08-16T10:47:47.951691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:47.461312Z","title":"Deep learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.461312Z"},"links":{"citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:56e35ee2ab7364ed374a231a30604f5699c99b6ffe03f4387f75585fba04f0f3","observation_id":"403d075b-e023-4843-9ea0-0f5399dc2fd7","resolution":{"observed_at":"2026-08-16T10:47:47.461312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-16T10:47:47.465781Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.465781Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:57870346916f144aef9feab0d69577a48f3a803acdfcaddc65348846093451b6","observation_id":"fcee8566-22ae-4eed-80c1-6355d9b72821","resolution":{"observed_at":"2026-08-16T10:47:47.465781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-08-13T18:24:04.904767Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-16T10:47:47.470788Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.470788Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:b9245134dc93dea32ba24459edf5c0101523b13c558fb6dca6edaf1460531104","observation_id":"46af64b2-b8e3-4125-917a-c519bb5b47df","resolution":{"observed_at":"2026-08-16T10:47:47.470788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:47.922723Z","title":"A survey on multi-task learning","venue":null,"work_id":"f724e388-2cb3-4cbd-9088-a52dd4f437f9","year":2021},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.476033Z"},"links":{"citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:223525055c0a58a9738a8f30d3083835759f74daafca884ef9d24c7f27a7cd7d","observation_id":"97bbf57a-3532-4290-8a5d-9a83750c5f29","resolution":{"observed_at":"2026-08-16T10:47:47.927089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:47.480190Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.480190Z"},"links":{"citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:7f57ad8bf511cac2dd8615ba5e19265b6ba6abea79099ede34756af0d5d93f3b","observation_id":"6935d653-19f3-46aa-a7e2-69f1ea800afa","resolution":{"observed_at":"2026-08-16T10:47:47.480190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11430","last_updated":"2023-10-17T17:40:21Z","snapshot_observed_at":"2026-08-16T14:51:18.057271Z","submitted_at":"2023-10-17T17:40:21Z","title":"An Empirical Study of Translation Hypothesis Ensembling with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11430","snapshot_observed_at":"2026-08-16T10:47:47.484285Z","title":"An empirical study of translation hypothesis ensembling with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.484285Z"},"links":{"cited_paper":"/paper/2310.11430","citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:428e3faaaf981691dc5745a72ffd8406d151474b773a9a2b45e830697bb534ef","observation_id":"2a25e677-5e52-4639-a666-8b5e28b382ce","resolution":{"observed_at":"2026-08-16T10:47:47.484285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:47.899892Z","title":"Optical character recogni- tion","venue":null,"work_id":"9d019461-273d-4467-95eb-b222c4f7a14e","year":2013},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.488580Z"},"links":{"citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:cddbba6c058947e486889d5f43d69bf1c4be0280189f848e0f803cc1351382d2","observation_id":"604153f1-8fca-492e-99b6-6e792bc5b711","resolution":{"observed_at":"2026-08-16T10:47:47.904388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:47.885760Z","title":"A survey on evaluation of large language models","venue":null,"work_id":"de2d84e0-d4ac-4d04-831d-6603e70c9803","year":2024},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.492420Z"},"links":{"citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:642874b57f155b7f1e3e5beeb208e0e6950d6e203d1fcefd0ca2810097770b59","observation_id":"3605f8bb-c856-495f-8e40-a0513dfb2c8c","resolution":{"observed_at":"2026-08-16T10:47:47.890502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:47.871903Z","title":"ChatGPT for good? On opportunities and challenges of large language models for education","venue":null,"work_id":"9e47a151-8af3-4d26-9f81-1ff487efd063","year":2023},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.496652Z"},"links":{"citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:5e6eb777b0fd4ca751602884098c49cd872d64c3e977a726e8fae0b7ccfc89a6","observation_id":"7219d817-b958-442c-91da-defe2cc6d403","resolution":{"observed_at":"2026-08-16T10:47:47.876496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-16T15:10:05.531358Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-08-16T10:47:47.500876Z","title":"Continual pre-training of large language models: How to (re) warm your model?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.500876Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:50590aa2cc6858ec00f38f2db85e4dd683181bd40d99307242f166ad928fa18a","observation_id":"9e75d4c4-e974-4390-91f0-802c0112428e","resolution":{"observed_at":"2026-08-16T10:47:47.500876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05492","last_updated":"2024-06-07T15:51:08Z","snapshot_observed_at":"2026-08-16T14:53:55.872485Z","submitted_at":"2023-10-09T07:56:16Z","title":"How Abilities in Large Language Models are Affected by Supervised Fine-tuning Data Composition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05492","snapshot_observed_at":"2026-08-16T10:47:47.505387Z","title":"How abilities in large language models are affected by supervised fine-tuning data composition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.505387Z"},"links":{"cited_paper":"/paper/2310.05492","citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:a6770fad6840f575bcc3cb007c01f3948af67d77da3089ebcdcf8cf9b7b80d3b","observation_id":"a82b8e21-60a5-4ff1-880f-1df157a127d0","resolution":{"observed_at":"2026-08-16T10:47:47.505387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-16T10:47:47.510015Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.510015Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:aaffc7cfc112f257b7f8b10598fc23f7d33b7be81a677b242d1fa066bafcdee9","observation_id":"5db83e95-d9e0-4a17-823f-44afd0d807b7","resolution":{"observed_at":"2026-08-16T10:47:47.510015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-16T10:47:47.514354Z","title":"Qwen2. 5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.514354Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:2d566604cbd7c64e56024ab8f4208b14c6daf0f9956c11f762e4a7ef34f52f89","observation_id":"455e59ca-f62a-49eb-bf65-92a0ee4aa882","resolution":{"observed_at":"2026-08-16T10:47:47.514354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-16T10:47:47.518908Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.518908Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:07a94ea16887ac0adab43fedaf81b75fdfd6c831aaca2c5f5c3919791e67c91d","observation_id":"ed1e2735-4177-4506-8001-bc0f25518fe7","resolution":{"observed_at":"2026-08-16T10:47:47.518908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:47.856057Z","title":"Perspectives and prospects on transformer architecture for cross-modal tasks with language and vision","venue":null,"work_id":"d9d488a3-076e-4286-aa2c-2c412b9a1a5a","year":2022},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.523484Z"},"links":{"citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:3b5524ff19b610c1c804d542351740a4e9af0fac01112f2b35f7870db7022626","observation_id":"42ea20de-f230-48a4-98e1-9f7793733e77","resolution":{"observed_at":"2026-08-16T10:47:47.860813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:47.840244Z","title":"Machine learning paradigms","venue":null,"work_id":"1125e728-2a3c-4029-864e-345f55a52d85","year":2015},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.527662Z"},"links":{"citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:bcfc7f00f0378f1b3b47d97db48575f9fe278318ff971e41dafec6011abdc55e","observation_id":"8c609b1d-26df-44bd-b872-b7cd8935c92b","resolution":{"observed_at":"2026-08-16T10:47:47.845366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:47.824833Z","title":"A comparison of multi-task learning and single-task learning approaches","venue":null,"work_id":"84ef2cc3-1b9b-4f5c-9561-8dfb1e03b163","year":2023},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.531891Z"},"links":{"citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:10f9c65242c0f301e37ec4b7393bd1bd438f025a239d8b90d973b799e3f44fc5","observation_id":"7ebbbc20-7f37-42dd-bf89-8e0205be7685","resolution":{"observed_at":"2026-08-16T10:47:47.829178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:47.810316Z","title":"HW-TSC’s Submission to the CCMT 2024 Machine Transla- tion Tasks","venue":null,"work_id":"e3fe7726-3094-43e5-be42-eebcbb6e00d4","year":2024},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.536110Z"},"links":{"citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:bf3d74f592e712e17fc1414a763eee186a43ec9af9d27ba6c4fedac038938dbb","observation_id":"591fc156-4013-4f24-a126-e614b9de4bf4","resolution":{"observed_at":"2026-08-16T10:47:47.814913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14800","last_updated":"2024-09-23T08:25:37Z","snapshot_observed_at":"2026-08-16T13:16:21.216131Z","submitted_at":"2024-09-23T08:25:37Z","title":"Choose the Final Translation from NMT and LLM hypotheses Using MBR Decoding: HW-TSC's Submission to the WMT24 General MT Shared Task","version":1},"cited_work":{"arxiv_id":"2409.14800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.14800","snapshot_observed_at":"2026-08-16T10:47:47.620543Z","title":"Choose the Final Translation from NMT and LLM hypotheses Using MBR Decoding: HW-TSC's Submission to the WMT24 General MT Shared Task","venue":"cs.AI","work_id":"8ff7c7b0-5765-4661-ad2c-230fe573a77d","year":2024},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.540546Z"},"links":{"cited_paper":"/paper/2409.14800","citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:129372cdfe5a674fb723afe29aa82a4cb7ce0bea6ca1b5903df420f64536bab5","observation_id":"4aaa53a8-1cb9-4ade-a0e3-830027787d9e","resolution":{"observed_at":"2026-08-16T10:47:47.625335Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:47.795280Z","title":"ImprovingtheQualityofIWLST2024CascadeOfflineSpeech Translation and Speech-to-Speech Translation via Translation Hypothesis Ensem- bling with NMT models and Large Language Models","venue":null,"work_id":"f2c65180-831f-477a-bf45-f3a0e6430427","year":2024},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.544972Z"},"links":{"citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:c2ea2592c98925befbc809c18dc133863bce1954d12adf92bfb21e6da075e3b7","observation_id":"26624a39-6366-49fb-9bca-76a5b8a4d557","resolution":{"observed_at":"2026-08-16T10:47:47.800247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:47.779885Z","title":"COMET: A Neural Framework for MT Evaluation","venue":null,"work_id":"8d43cfc1-f464-4a1b-8a6d-599296aff649","year":2020},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.549272Z"},"links":{"citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:ae11b4589f725749d085c026c7b965976643d1ba545b7791ef499d51e8f791a3","observation_id":"707e9544-7332-4711-b299-ca1099d5b060","resolution":{"observed_at":"2026-08-16T10:47:47.784757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:47.764989Z","title":"COMET-22: Unbabel-IST 2022 submission for the met- rics shared task","venue":null,"work_id":"b7215c35-86f2-41bf-8f6a-dfbc0c466c36","year":2022},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.553556Z"},"links":{"citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:ec62efce541ab32b66378e5a7ff8abe1d8573c60acdc763bbad1a2646e7062e9","observation_id":"c1609d2a-32e7-4371-8a1f-424cf017e222","resolution":{"observed_at":"2026-08-16T10:47:47.769912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:47.558093Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.558093Z"},"links":{"citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:e0a6b6ba9b4eaefe0a96f826de5675f7161ad07698bd798c446f986d5aab8afd","observation_id":"0a1690c7-7106-444c-911d-b7a9bf81133a","resolution":{"observed_at":"2026-08-16T10:47:47.558093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13945","last_updated":"2025-05-19T06:35:05Z","snapshot_observed_at":"2026-08-16T12:40:38.169640Z","submitted_at":"2025-04-16T03:08:57Z","title":"Evaluating Menu OCR and Translation: A Benchmark for Aligning Human and Automated Evaluations in Large Vision-Language Models","version":4},"cited_work":{"arxiv_id":"2504.13945","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.13945","snapshot_observed_at":"2026-08-16T10:47:47.597642Z","title":"Evaluating Menu OCR and Translation: A Benchmark for Aligning Human and Automated Evaluations in Large Vision-Language Models","venue":"cs.LG","work_id":"ed2cd244-7fe7-4635-8573-acf82340e3f4","year":2025},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.562309Z"},"links":{"cited_paper":"/paper/2504.13945","citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:f4d9732fd7183b9e89ed066bce35fca4fe430ca350e7493ba6100f8b37d4b659","observation_id":"9a02fca6-6b1b-44a6-b0a7-992664cae950","resolution":{"observed_at":"2026-08-16T10:47:47.604611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T10:40:50.742026Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2504.17315."}