{"as_of":"2026-08-09T21:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:282ab6ad1fbe557d6264bc0d662bfe9a5f1f8b3a3d77750e3f015293e3a4a67a","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:54:56.474300Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.07411/citation-record","integrity":"/paper/2502.07411/integrity","json":"/paper/2502.07411/citation-record.json","paper":"/paper/2502.07411"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-08T12:54:56.114885Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.114885Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:89d791c1cfad0a3071cc0b9baac73cfb628bce140ce8d6d2af071d997a8cc5ae","observation_id":"20a166fa-0211-4747-8913-f525b65029fa","resolution":{"observed_at":"2026-08-08T12:54:56.114885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:56.120306Z","title":"Where did i leave my keys? - episodic-memory-based question answering on egocentric videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.120306Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:0d690ad2891c7b5809a561e81167b817c6c370c8c39d39b762c5de30f6464ba0","observation_id":"70b606bd-fcfd-4e71-ba3c-c5b514aa235a","resolution":{"observed_at":"2026-08-08T12:54:56.120306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:56.124737Z","title":"Scene text visual question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.124737Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:7c4af3700c34440475c0377ce503a0441d82c9ecea4de37f480feb969cf4662c","observation_id":"12c78ca8-94ce-4a70-bc4c-046db810186f","resolution":{"observed_at":"2026-08-08T12:54:56.124737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13418","last_updated":"2023-08-25T15:03:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-25T15:03:36Z","title":"Nougat: Neural Optical Understanding for Academic Documents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13418","snapshot_observed_at":"2026-08-08T12:54:56.129066Z","title":"Nougat: Neural optical understanding for academic documents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.129066Z"},"links":{"cited_paper":"/paper/2308.13418","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:3babd11333d0912fabbe9841db8832d954cfcc5b369e6fd1742abae826116782","observation_id":"701d60ec-cf0d-4114-9199-9c1eea17b542","resolution":{"observed_at":"2026-08-08T12:54:56.129066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-08T12:54:56.133631Z","title":"Internlm2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.133631Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:355615369c0f5d4f5f57a6e72e98ad0e11b660cb2fdb7a5643e28e3f534e44f3","observation_id":"6b7ebe36-a71a-44df-b74c-9fb4f39b937c","resolution":{"observed_at":"2026-08-08T12:54:56.133631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-08T12:54:56.138227Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.138227Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:61b56fbe6c5f45ddbf588d7cb57581917914e6b891268d56db182b1867a28436","observation_id":"6a3ad532-9edd-4f91-a7da-72196dccc641","resolution":{"observed_at":"2026-08-08T12:54:56.138227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-08T12:54:56.142716Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.142716Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:bc30930aa025eadb3f7d8f95ada35bccc75e37663acf06aaeeb1b8796de339bb","observation_id":"adb75ff9-37fb-458b-a65c-3d2cbbcc3648","resolution":{"observed_at":"2026-08-08T12:54:56.142716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:56.147036Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.147036Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:549f8dfe1bf016d9430aa2b8340e3253ed49efc43a65df56945bae67e10e94a0","observation_id":"d9661cac-6181-4b7a-bee4-f2a91c45d520","resolution":{"observed_at":"2026-08-08T12:54:56.147036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11623","last_updated":"2024-10-15T14:08:53Z","snapshot_observed_at":"2026-07-06T19:33:52.737083Z","submitted_at":"2024-10-15T14:08:53Z","title":"VidEgoThink: Assessing Egocentric Video Understanding Capabilities for Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11623","snapshot_observed_at":"2026-08-08T12:54:56.151522Z","title":"Vide- gothink: Assessing egocentric video understanding capabili- ties for embodied ai.arXiv preprint arXiv:2410.11623, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.151522Z"},"links":{"cited_paper":"/paper/2410.11623","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:5ea9033a6b43c1880994f8776d6096982e7a6261da8ea9e238463fd855c8f1f7","observation_id":"4b68f2c0-dcc7-4251-8541-cfa9be868bbd","resolution":{"observed_at":"2026-08-08T12:54:56.151522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:56.156323Z","title":"Egothink: Evalu- ating first-person perspective thinking capability of vision- language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.156323Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:23e14571305bbfae36fc209c400b00c477d4c892a7109daccee366680596bede","observation_id":"5b98d8e6-29cf-4455-bb5c-51f67345d832","resolution":{"observed_at":"2026-08-08T12:54:56.156323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:56.160240Z","title":"Grounded question-answering in long egocentric videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.160240Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:50caa55f3c278abc7d2e5e31c476f513d2eaaa0f8c2590b55eff5ae81791a10c","observation_id":"cdef0dc8-631b-43ab-86e0-740dde11ec80","resolution":{"observed_at":"2026-08-08T12:54:56.160240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:56.164622Z","title":"Egovqa-an egocentric video question answer- ing benchmark dataset","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.164622Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:83e621fd3fd6d4c7f4cb9c0756cb7120d9705c3ffa8d440140f7b02f7733d0b6","observation_id":"060f0cb2-c727-4ea5-a003-85cc2ce94246","resolution":{"observed_at":"2026-08-08T12:54:56.164622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-08T12:54:56.168704Z","title":"Video-mme: The first-ever compre- hensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.168704Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:90db49517e1c9df6baab1f7b0927468610b469074b9142541ce886828cbfed32","observation_id":"320ac191-1522-4b26-8062-0dac98c0c302","resolution":{"observed_at":"2026-08-08T12:54:56.168704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:56.173248Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.173248Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:ce89244cb00b29cd1ae0d2b12725b85c76e3c3b2f25234a9222ff16d406936f5","observation_id":"4a1f8428-c2b7-4097-9d5c-e43294e33dfe","resolution":{"observed_at":"2026-08-08T12:54:56.173248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.607068Z","title":"Context-aware graph inference with knowledge distillation for visual dialog.IEEE TPAMI, 44(10):6056–6073, 2021","venue":null,"work_id":"a26685a0-d88e-4104-9652-c28eeeab6444","year":2021},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.177341Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:bda4984a56b7569ce280c4f0f4215f885e58dbe6b1d290676cd4dc061a910ad6","observation_id":"cd64bf27-6376-4f56-853d-a0148fe9ab1b","resolution":{"observed_at":"2026-08-08T12:54:57.611618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.594368Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":"75d840e3-b7f2-4ae6-8db3-9da0b36ea428","year":2018},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.181352Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:700087dab4bbfd6ad94e4bc086fdb8b0337a70aa41e76e646ceaf799cd37d4c5","observation_id":"9cf3228b-03da-46f6-970d-c11f31eb9879","resolution":{"observed_at":"2026-08-08T12:54:57.598545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07080","last_updated":"2024-10-08T03:26:17Z","snapshot_observed_at":"2026-08-09T18:03:15.637660Z","submitted_at":"2024-01-13T13:59:15Z","title":"GoMatching: A Simple Baseline for Video Text Spotting via Long and Short Term Matching","version":2},"cited_work":{"arxiv_id":"2401.07080","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.07080","snapshot_observed_at":"2026-08-08T12:54:56.765784Z","title":"GoMatching: A Simple Baseline for Video Text Spotting via Long and Short Term Matching","venue":"cs.CV","work_id":"5edc96c7-82aa-4cbb-af4c-7b4a25cc47d3","year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.185230Z"},"links":{"cited_paper":"/paper/2401.07080","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:fa18cdfe7e6a3f919895170fab409581a561592f4e6e5aa75d7fb851345ad405","observation_id":"9a8936b8-d246-4859-9ec9-d5c652b389c6","resolution":{"observed_at":"2026-08-08T12:54:56.771045Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-05T11:54:14.447608Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-08T12:54:56.189601Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.189601Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:c96939ca55d80dfda99c9e22fdfadc26d3e5133a3681af7fae7614be5af8ed8c","observation_id":"b749407b-50fe-48b0-a978-ce8c3d8f9694","resolution":{"observed_at":"2026-08-08T12:54:56.189601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.580741Z","title":"Understanding video scenes through text: Insights from text-based video question answering","venue":null,"work_id":"9777a288-24f1-48bb-a5dc-696711b3e7df","year":2023},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.193845Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:eaeefa8e59d5ff7034647a937b26151030b07b0ed9eded3ce84d56a174c91b37","observation_id":"a9b38a20-4d6d-4bd2-b78b-d9538c0a23b8","resolution":{"observed_at":"2026-08-08T12:54:57.585323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.567149Z","title":"Egotaskqa: Understanding human tasks in egocentric videos","venue":null,"work_id":"c98911ab-2f25-42c2-a989-71e2fd9094ee","year":2022},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.197727Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:f378282c76155f235d85d83f5320b88f19dfe526272c0844651b3df2575b9727","observation_id":"1e950c31-aac4-469b-89d8-369b270623c6","resolution":{"observed_at":"2026-08-08T12:54:57.571518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.554419Z","title":"Llava-next: Stronger llms supercharge multimodal capa- bilities in the wild, 2024","venue":null,"work_id":"50438228-ba9c-4fb2-aec3-65466bd73a35","year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.201725Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:5d6fd69284d66173c75dabc23d708d14945780b6170c7db883bf44b76ed876ad","observation_id":"de1cdeb5-a53e-4964-9007-ac5b3d5ba440","resolution":{"observed_at":"2026-08-08T12:54:57.558677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03001","last_updated":"2022-06-14T12:00:10Z","snapshot_observed_at":"2026-07-06T13:18:06.376608Z","submitted_at":"2022-06-07T04:33:50Z","title":"PP-OCRv3: More Attempts for the Improvement of Ultra Lightweight OCR System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03001","snapshot_observed_at":"2026-08-08T12:54:56.205791Z","title":"Pp-ocrv3: More attempts for the im- provement of ultra lightweight ocr system","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.205791Z"},"links":{"cited_paper":"/paper/2206.03001","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:d94c521675f8029ebe0697f6fffe863fbe03522428f0899375dba3362e7858b5","observation_id":"7ddea211-36e8-41b0-a85b-d97653ced7d2","resolution":{"observed_at":"2026-08-08T12:54:56.205791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.541669Z","title":"Flex- attention for efficient high-resolution vision-language mod- els","venue":null,"work_id":"caeccabe-5cd3-498b-9a8c-f8798d535fba","year":2025},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.209825Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:e3366b01bff75c87b1f0975a272961c8a86d23b2f1ac60a7dbdbf44191cbf128","observation_id":"bc3bc08a-889d-45db-ab84-ad27feba1338","resolution":{"observed_at":"2026-08-08T12:54:57.546062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.528209Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":"cc595679-a3c3-4b73-a8c4-2e10c0533f1a","year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.213744Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:8a7ba21e806b368bc97b3aa647cddd909b56be46d783f6fbba7dbb0e65df530f","observation_id":"e573457e-0ffe-4b46-9ccb-2873f6e870fd","resolution":{"observed_at":"2026-08-08T12:54:57.532537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.514906Z","title":"Invariant grounding for video question answering","venue":null,"work_id":"76b25edc-89a3-465e-bc6c-7b50ad3eebc6","year":2022},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.217734Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:48d2226fade1bdaaf176b9905e972b25e0b9e7bfaffa6f891ae19ebc75d5e0dc","observation_id":"ad03128f-81c0-439f-b859-7bbc660cd8ab","resolution":{"observed_at":"2026-08-08T12:54:57.519362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.501392Z","title":"Transformer-empowered invariant grounding for video question answering","venue":null,"work_id":"eeaec0f3-e950-441b-9b8b-3c332c15cd1c","year":2023},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.221976Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:fabbfd0ebc212c3725ee0378d39c780f839aef4fbf9634066d9366e71927e539","observation_id":"11d2956c-034d-4817-8ebd-446f2ec62029","resolution":{"observed_at":"2026-08-08T12:54:57.506144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.487812Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"2c256944-3d20-487c-a131-fb3b2e7d93f7","year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.225880Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:11d0b54a967c082f23652a710f9c543271e7bef2d1d75f062619571a4bf43518","observation_id":"832a7826-8ac0-4a40-9743-48d429db36a9","resolution":{"observed_at":"2026-08-08T12:54:57.492342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.474601Z","title":"Egocentric video-language pretraining","venue":null,"work_id":"5de776ad-6ad8-4183-aa7e-bbc15fa71baa","year":2022},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.229826Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:8e4231a078a1597e92b61e1c8ca38c1e7bde4b0d0fc519ab1fb8188138f353b5","observation_id":"35ec54d9-b5ae-410c-a685-7a899fc47138","resolution":{"observed_at":"2026-08-08T12:54:57.478968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.461029Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"d1cc2a88-16fe-48b5-9e84-01124838cff6","year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.233949Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:bf13b83dfdd7d5c01706a299ccafe6dd4e76c301a848a4807022d5dc627422cd","observation_id":"afa12dbe-bca5-4a39-8c19-f12ce12055ac","resolution":{"observed_at":"2026-08-08T12:54:57.465382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.446968Z","title":"Ocrbench: On the hidden mystery of ocr in large multimodal models, 2024","venue":null,"work_id":"411d4f81-26f3-45d7-a526-2a7233e0e104","year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.238033Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:3e0f7d9b8729d1db86573f82cd04eafc98d7320db0b1f5ad4942380a0c027f90","observation_id":"3f9cd5da-9089-41e9-9dc0-b25fbb69f521","resolution":{"observed_at":"2026-08-08T12:54:57.451768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-08T12:54:56.241899Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.241899Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:2117a3bb0537d66bdf2a60021c0dd2403fd3b9df7288926731bd19902315a1b5","observation_id":"479d4a04-a8e8-44c7-89c6-c9552dd96ba4","resolution":{"observed_at":"2026-08-08T12:54:56.241899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-08T12:54:56.246341Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.246341Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:fea239d9fd64a421f657af26cd2bd874a093592c84241ab6a794c7eb78b7bdcf","observation_id":"021e9583-38fd-4bca-9973-fa36d7b69e7d","resolution":{"observed_at":"2026-08-08T12:54:56.246341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.432652Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding","venue":null,"work_id":"85398b07-dd12-403b-9dac-0fde15cc95f3","year":2023},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.250465Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:2300362f06cdc3e878d4b621c826948fbbd40bd616067280ddf9561bda0f73fe","observation_id":"47d7ef9f-b74f-4650-85d7-479402dc0a49","resolution":{"observed_at":"2026-08-08T12:54:57.437157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.418788Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"ba9d5f30-b673-444f-afff-6cd02e1f43c5","year":2021},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.254547Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:f67f25e2d37d3a5a594d2fc57ff1e6756e2b20f5a8d4cb1c63294c4f4ce449c9","observation_id":"6e4a0a78-fd94-4af5-9336-0400dd24e2b4","resolution":{"observed_at":"2026-08-08T12:54:57.423250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.405028Z","title":"Infographicvqa","venue":null,"work_id":"135c3dca-cfd7-4ebf-aaaf-3f680ef2e2bd","year":2022},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.258520Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:25e86bb553931f78f28b02e97573895e7e0792505146304465e1d957107f1649","observation_id":"078de082-67ba-4d79-abcc-6bc671999581","resolution":{"observed_at":"2026-08-08T12:54:57.409491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.391061Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":"32c7add6-b082-4e79-a555-f4efd2869cd8","year":2019},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.262488Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:785202c4fc111886488c29724d6235d6fe62ff52ef593ff4c10d663e0ad6dfa2","observation_id":"78603dc3-316d-4193-9e7b-c32dfcbcb91e","resolution":{"observed_at":"2026-08-08T12:54:57.395858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.377632Z","title":"Gpt-4o system card","venue":null,"work_id":"4b29b4ab-f896-41e5-9ec5-9d90963ad1f7","year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.266298Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:222bde6442a20d302c79483fede08de2128d53e6f1016d6abba2d87b2cb34d80","observation_id":"ee178bbd-26bf-4bf4-ab7a-c2d1842cf9e8","resolution":{"observed_at":"2026-08-08T12:54:57.382022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:56.270226Z","title":"Gpt-4o mini: advancing cost-efficient intelligence","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.270226Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:623b531b5298d466535314624475cfb5aef2b985fb8043e946959599f495fa24","observation_id":"d88a5540-81ff-4582-ba0e-db44de5c68fd","resolution":{"observed_at":"2026-08-08T12:54:56.270226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.355322Z","title":"Egovlpv2: Egocentric video-language pre-training with fusion in the backbone","venue":null,"work_id":"7fbe8c7c-8d5e-4469-a418-94fdef66f26f","year":2023},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.274244Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:9beb8a8dd6f453b98a57c74b85fd96f417deadb751ac8a4f050a78feaf46611b","observation_id":"2b8c4d99-595b-4aa8-b55d-507fefc2139a","resolution":{"observed_at":"2026-08-08T12:54:57.359826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.342099Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"d11ffb87-4c3d-4f62-9874-bf5aa4e8abde","year":2021},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.278216Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:ed97b345bef6bfadba8bdbdb0315927a4ce083c41ab8b88ec700fbc79a7494a3","observation_id":"1a549ecd-6650-4be7-97ab-26169dfee7ff","resolution":{"observed_at":"2026-08-08T12:54:57.346472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-08T12:54:56.282084Z","title":"Gemini 1.5: Unlocking multimodal under- standing across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.282084Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:747f096511c4f863ce34c411446f320d5c404dc6dd14b88f51a073aec4aa32c3","observation_id":"b40979d0-1bb6-450f-af94-f324be730f5a","resolution":{"observed_at":"2026-08-08T12:54:56.282084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-08T12:54:56.286985Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.286985Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:f7ae2fed037b3ba45a9032cddf6dc574ac862c80a7d77f6d2d254ed053e8825f","observation_id":"79a9a262-70b9-4325-b797-1de2079f524e","resolution":{"observed_at":"2026-08-08T12:54:56.286985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.328991Z","title":"Annotating objects and relations in user- generated videos","venue":null,"work_id":"c69baa5e-a053-440e-be3a-a53c4a55234d","year":2019},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.291155Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:c5ce7c0e81c2cf24e52d844d59ceb3c37120a952aabf2ce837cb505504edb7f9","observation_id":"bd87f972-824e-4eb2-943b-4e0dad9ca5a9","resolution":{"observed_at":"2026-08-08T12:54:57.333415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-08T12:54:56.295240Z","title":"Glu variants improve transformer","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.295240Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:4d4ac915dc6238bc6d238bc5aad999da25539e6bd78ea37b21721c07fccb4925","observation_id":"ad865063-2f7f-46ff-8da0-c522eb334193","resolution":{"observed_at":"2026-08-08T12:54:56.295240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.315442Z","title":"Towards vqa models that can read","venue":null,"work_id":"1eace16f-143c-4f37-8a44-2a24475448fa","year":2019},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.299537Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:09a47c9436d7f7c044700ebb5da8a59bdf123b41eba86db49da4b7699b82b35d","observation_id":"1f35c8e7-ee3a-4a8a-b152-e8ba7621aba7","resolution":{"observed_at":"2026-08-08T12:54:57.319919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-08T12:54:56.303789Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.303789Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:c090f7ab688bd944f6d5918a34fd15b66f9435552013606e276c01573af7a0d1","observation_id":"7f75d1ff-79d6-49ef-ad9d-e34462632914","resolution":{"observed_at":"2026-08-08T12:54:56.303789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-08T12:54:56.308154Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.308154Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:2a7a8edeedc89dfe455b0c1d083aabc7e384df3695219382e58eaa77f3ea577d","observation_id":"322010f4-f1b3-4cb8-b534-b2a38c6f2186","resolution":{"observed_at":"2026-08-08T12:54:56.308154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.302503Z","title":"Reading between the lanes: Text videoqa on the road","venue":null,"work_id":"c1954305-bde7-4dda-b20a-0fd76b24fcba","year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.312592Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:37921df89ecf0274979f7142e5ada539989f2aba0b3bd8be035c003d4419d524","observation_id":"1c5febe1-94b6-4db5-9200-00f1c50ca31b","resolution":{"observed_at":"2026-08-08T12:54:57.306916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-08T12:54:56.317080Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.317080Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:a0a9605d356041bf8933e60668405580dfc68ecfdbb4da308f3b0ecb5459cf12","observation_id":"ac6caca4-760a-4449-ae7f-b41e840b3571","resolution":{"observed_at":"2026-08-08T12:54:56.317080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-08T12:54:56.321415Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.321415Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:d7c653cc05e2fab642cb904d21c00453ea2b188351495769307bb45c3daa8108","observation_id":"505a1408-9d54-4ed5-a34d-ef627ddcb886","resolution":{"observed_at":"2026-08-08T12:54:56.321415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-08T12:54:56.325636Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.325636Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:4857c41447ba881339eb9afae84149fea7bf1f02cd03f6b296a12a7fc2221029","observation_id":"e0dce2cd-fd45-4e5c-8037-27e7602e7d54","resolution":{"observed_at":"2026-08-08T12:54:56.325636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.288965Z","title":"On the general value of ev- idence, and bilingual scene-text visual question answering","venue":null,"work_id":"e3bf8b98-bbad-4bb3-8c8f-518d0bc89a9c","year":2020},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.329931Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:4445f5ea393ba146c40fd0d2d0a9913edd08a7a29e83ca1c5b8da57444e68c48","observation_id":"ce44bf7e-1841-465e-b4d6-66bba7d0d2bb","resolution":{"observed_at":"2026-08-08T12:54:57.293858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.275371Z","title":"Assistq: Affordance-centric question-driven task completion for ego- centric assistant","venue":null,"work_id":"49d26a3d-f787-4274-9ceb-cc6fb43e4a8f","year":2022},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.334020Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:d95658346376e4883a5b3cdafc6b9a2414af4597552ced4d7ab936200fcccbdc","observation_id":"3c6960a3-522f-49e1-924d-5beab171956a","resolution":{"observed_at":"2026-08-08T12:54:57.280040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.261886Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":"bca8f854-fce6-4b9a-9809-c42e4c129401","year":2021},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.337940Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:0dfc631e5636f722a0203c6a8ab05ad983f5d72c5e3f401abc96c0452f56eb49","observation_id":"21504019-c8a1-4b2a-b024-8bcaaa3c39ae","resolution":{"observed_at":"2026-08-08T12:54:57.266470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04223","last_updated":"2025-06-14T12:40:12Z","snapshot_observed_at":"2026-07-06T18:58:13.862931Z","submitted_at":"2024-08-08T05:14:07Z","title":"VideoQA in the Era of LLMs: An Empirical Study","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04223","snapshot_observed_at":"2026-08-08T12:54:56.342107Z","title":"Videoqa in the era of llms: An empirical study","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.342107Z"},"links":{"cited_paper":"/paper/2408.04223","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:943aef78accda34d34dd69dccd8090f25ee6a5b92f91f391a6a6a85af63a764f","observation_id":"bc512d6f-164a-4ff4-91ac-0044c19ddbab","resolution":{"observed_at":"2026-08-08T12:54:56.342107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.248130Z","title":"Deconfounded video moment retrieval with causal intervention","venue":null,"work_id":"8e53747c-da25-48c8-a42c-aa10d8a3dd88","year":2021},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.346273Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:845c850f853c21bec5dc131eaa6fee4984c3a39be18398b23ae50266266f194d","observation_id":"de7ca57f-0f03-4635-ba80-185cf6a168b2","resolution":{"observed_at":"2026-08-08T12:54:57.252848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.234796Z","title":"Video moment retrieval with cross-modal neural architecture search","venue":null,"work_id":"5223a935-6482-438c-aecc-c852a83c7316","year":2022},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.350327Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:02d808a9377cc1d1fc9ec65f1fba7e66459e5ca81049a75238c36d6593b7c954","observation_id":"579d69eb-bbc1-4f7b-b01e-272581b454eb","resolution":{"observed_at":"2026-08-08T12:54:57.239274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.220308Z","title":"Robust video question answer- ing via contrastive cross-modality representation learning","venue":null,"work_id":"8571f4cb-4993-42ee-9262-dcf794f03873","year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.355088Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:f18254c036fc9bbd5279f64ca34c743d439bdd2c0c8e1a0fc2dc5e58d679209c","observation_id":"dcb06e1c-a964-4ef3-bab3-768a016de2e9","resolution":{"observed_at":"2026-08-08T12:54:57.225574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-08T12:54:56.359154Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.359154Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:083f1fc57fd7d550d235e013e0d3c62adfb62609a6700612b02efbd6edc810de","observation_id":"028fa900-a965-4130-b355-e1a364996573","resolution":{"observed_at":"2026-08-08T12:54:56.359154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07177","last_updated":"2025-04-13T12:27:56Z","snapshot_observed_at":"2026-08-09T06:47:11.559636Z","submitted_at":"2024-10-09T17:59:59Z","title":"MM-Ego: Towards Building Egocentric Multimodal LLMs for Video QA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07177","snapshot_observed_at":"2026-08-08T12:54:56.363353Z","title":"Mm-ego: To- wards building egocentric multimodal llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.363353Z"},"links":{"cited_paper":"/paper/2410.07177","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:f82d9d362b3fe5d14345bed9d5e2b155f0eca8fce0f3bf5437db86d85869bbc3","observation_id":"eb601c86-bfa8-4d66-b3ba-f2c41546f759","resolution":{"observed_at":"2026-08-08T12:54:56.363353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.206393Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"3239c7ad-4be6-4511-b48c-badae2f937ac","year":2023},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.368065Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:9d032fa2f7ecedd1bb5a05dff9fc6add752442f3a2ef58e5daf0b233ea9aeaa9","observation_id":"9437a4c9-1fae-4824-a387-cdecb0997592","resolution":{"observed_at":"2026-08-08T12:54:57.211122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.192698Z","title":"Multi-factor adaptive vision selec- tion for egocentric video question answering","venue":null,"work_id":"82e65e14-6a3c-4345-aea2-d3e51a61c832","year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.372009Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:106954cd16e5224e314ec9bef942c966a230b02790ff10f3939689a7b5838dad","observation_id":"743af68e-86a0-4e98-a5c4-6662b4f6faf3","resolution":{"observed_at":"2026-08-08T12:54:57.197499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19185","last_updated":"2024-07-27T05:53:37Z","snapshot_observed_at":"2026-08-07T12:51:40.943810Z","submitted_at":"2024-07-27T05:53:37Z","title":"LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19185","snapshot_observed_at":"2026-08-08T12:54:56.375610Z","title":"Llava-read: Enhancing read- ing ability of multimodal language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.375610Z"},"links":{"cited_paper":"/paper/2407.19185","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:b4380da48bb262baf31252c05f04b79b73d33679be0e4b65d7cfa7b37b2a6863","observation_id":"03acbac3-de00-4c32-926f-a2c60e18e971","resolution":{"observed_at":"2026-08-08T12:54:56.375610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.178630Z","title":"Llava- next: A strong zero-shot video understanding model, 2024","venue":null,"work_id":"4ac53d15-7a61-42df-96a6-a8bc91a03de3","year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.379684Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:b020467a047f85f2088a6899cb3383299336065b1462153fb73158a4c92d7d63","observation_id":"c964b9ad-5945-4630-94c1-15f72c0224b5","resolution":{"observed_at":"2026-08-08T12:54:57.183592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.165003Z","title":"Diffusion-based blind text image super-resolution","venue":null,"work_id":"64aef8c8-cd20-4f01-bc1d-65704941362b","year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.383600Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:f360ccb453f60ade25034b65956796f9f97d0afc05ca22d06e1df4fb6693ed79","observation_id":"6490b45e-29a4-45bb-a171-635ebdb7bd6c","resolution":{"observed_at":"2026-08-08T12:54:57.169518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-06T01:10:51.539456Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-08T12:54:56.387608Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.387608Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:a3116af81798d4b71cd7756308ef9c9b4637d1a03388d8953635fbb10a419855","observation_id":"8c8b5f18-f5f1-4841-8f7e-5927283508ab","resolution":{"observed_at":"2026-08-08T12:54:56.387608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.151361Z","title":"Towards video text visual question answering: Benchmark and baseline","venue":null,"work_id":"7c8718ea-2cb5-44ff-9f48-2b9d5a622a04","year":2022},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.391728Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:3f9c48e0357bf201f5635c04a9af27cad590838d12713f552ef47a3120b41d2a","observation_id":"0dd917b1-93d0-4ce9-94f5-f25fc4a8ae42","resolution":{"observed_at":"2026-08-08T12:54:57.156198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.137397Z","title":"Exploring sparse spatial relation in graph inference for text- based vqa","venue":null,"work_id":"23776d3e-0f7e-4927-84d3-f0161123d56e","year":2023},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.395299Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:398c9319083b9d708023560a0642027ff6d65c99c9da82827b02eac0458c8b36","observation_id":"72714bec-23ec-4e34-a8fa-b3ab4e74f246","resolution":{"observed_at":"2026-08-08T12:54:57.142122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14319","last_updated":"2025-05-19T06:06:13Z","snapshot_observed_at":"2026-07-06T19:19:20.298433Z","submitted_at":"2024-09-22T05:13:11Z","title":"Scene-Text Grounding for Text-Based Video Question Answering","version":3},"cited_work":{"arxiv_id":"2409.14319","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.14319","snapshot_observed_at":"2026-08-08T12:54:56.509802Z","title":"Scene-Text Grounding for Text-Based Video Question Answering","venue":"cs.CV","work_id":"ff8b519f-578f-4d50-98cc-0a5b46106098","year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.399357Z"},"links":{"cited_paper":"/paper/2409.14319","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:d1a06bc54780ce6410f138b4665b7253fff34e813be28f35afeff1437a2b98a1","observation_id":"68071ac0-de17-4ee3-9072-9ca247484a51","resolution":{"observed_at":"2026-08-08T12:54:56.516262Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.123771Z","title":"I” should be used appropriately. Requirement 5: The questions should be of moderate length. When announcing the question please label each question as “Question 1, 2, 3: {question}","venue":null,"work_id":"8abca1c8-7875-41db-b660-bfd28f7d9f75","year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.404806Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:58f5db2a373fecb99400104d80f51c1f0d798cd67ea1c8007ca689c83cf65dbd","observation_id":"5cc3978e-f96d-4cba-a5aa-c51c18902e0e","resolution":{"observed_at":"2026-08-08T12:54:57.128528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.110232Z","title":"For example:","venue":null,"work_id":"1003f079-0bf1-401c-bd8a-5da8a488cab6","year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.408988Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:8d0b5f583fe31611d67ac703605126ae7fb86ec28267ebf6070f2ece98545aa9","observation_id":"e2e47122-0bb7-4a7c-b3bd-dfa58fb80fa8","resolution":{"observed_at":"2026-08-08T12:54:57.114701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.095873Z","title":null,"venue":null,"work_id":"8f6dbc14-181b-46d5-b9ac-4a2460e12fa4","year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.413149Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:50220cfaad1264fd36e8daeeb4ef2bf6659e07ab92df5d9dd1a89e4f046608d5","observation_id":"2b9872bd-9eab-43fe-9ccb-b8c93b47c37c","resolution":{"observed_at":"2026-08-08T12:54:57.100405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.082372Z","title":null,"venue":null,"work_id":"f6d00468-af0c-4159-9e7a-9c37c3e85c73","year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.417105Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:30968390c94844afe81a295e975ec9560f1f9c29e5f1cf9a7aa6c1e082edab70","observation_id":"458701d6-fef6-4b9e-9a3f-844702db5b7d","resolution":{"observed_at":"2026-08-08T12:54:57.086757Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.068662Z","title":"For example:","venue":null,"work_id":"29edd3b6-b2f4-4568-86cc-be8ef3b8c507","year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.421837Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:c2141192a034cbbfd2f20a20781fcf7c910f6a30f66e5e248a3f6efe267bfda6","observation_id":"54dec6c6-efc5-4252-97c2-4b18cbce608f","resolution":{"observed_at":"2026-08-08T12:54:57.073350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.055381Z","title":null,"venue":null,"work_id":"5e8b0c5d-a155-4548-97f2-d2030b15807c","year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.425714Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:8e9a86085ed14653ed74f521583e6f8f634297d74b90125ff4299679dd2d27ed","observation_id":"82e9b652-e3b4-40f4-aa59-b4cecc0acba3","resolution":{"observed_at":"2026-08-08T12:54:57.059763Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.041834Z","title":null,"venue":null,"work_id":"3f0851bd-cad8-4556-b77a-8530b15a8df3","year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.429588Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:7414cba3a2de1678dbe3d2ca18dfb5b6ecebfc9a91645535cefb4c814798fc90","observation_id":"a1ed87b2-e23a-473e-a0a2-10f9877f776c","resolution":{"observed_at":"2026-08-08T12:54:57.046256Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.028077Z","title":null,"venue":null,"work_id":"42937280-d806-44ea-aaa4-125cdb8272d4","year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.433279Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:a776fa611b25a131b5458f9f1bc1adef3d4d281b5e68eb02ff9b79dc2f79fa7d","observation_id":"a97fc98a-d790-4ae9-96b9-b64303857f51","resolution":{"observed_at":"2026-08-08T12:54:57.032389Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:57.014242Z","title":"For example:","venue":null,"work_id":"b230c1d1-935c-4f41-8e95-fa65c0dc42be","year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.437721Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:4d77a5e914d0b81bd9d422e6bfb926114dfeadf4b687dc56b915c9a47e57f811","observation_id":"0a2249fe-e1cd-4213-91f8-40bdbd6c6474","resolution":{"observed_at":"2026-08-08T12:54:57.018820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:56.999207Z","title":null,"venue":null,"work_id":"9ff077fa-238e-4f9b-b971-2d8ca53c3f47","year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.442124Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:ee5e00d71e1acfa54133a7a7dbd89a93070148bf56dc0d67932948b0b9ed4c5d","observation_id":"5b4ca62c-4072-42f2-acf9-3f8579a0c459","resolution":{"observed_at":"2026-08-08T12:54:57.004118Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:56.984682Z","title":null,"venue":null,"work_id":"f490882a-ae65-4ffb-a169-a4490b45b066","year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.445784Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:7a0deb827acce9c5787e8fd54cced5008204e09113a94c6b2b4f36fda80b9f84","observation_id":"22df1ca5-ea0d-4615-beff-1780dbe5dafa","resolution":{"observed_at":"2026-08-08T12:54:56.989360Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:56.971057Z","title":null,"venue":null,"work_id":"33787b37-1072-47a7-8a0e-4ac4be0ae775","year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.449378Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:8b315f784af51d0c2841765ce917a3c61160a4a3911217dfed88ae05b5e3123a","observation_id":"c703cccc-3d52-47c6-aa33-797bd13546f4","resolution":{"observed_at":"2026-08-08T12:54:56.975681Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:56.955858Z","title":"For example:","venue":null,"work_id":"745fc9b1-ecae-49d6-bb89-1d3188f7d981","year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.453801Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:f3fc6193f42cb331bef1e629862efa6dea8178ed2885b12f66da719c10ed98ff","observation_id":"9c8d3008-3003-4077-b3ff-77a4a12865ad","resolution":{"observed_at":"2026-08-08T12:54:56.961082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:56.940840Z","title":null,"venue":null,"work_id":"b1b78a8d-97a9-467f-9fb7-a34422843c57","year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.458157Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:124d8d0554d9a315507b2ced516b194cffa30e23a4ae51bfbd0faccec100f692","observation_id":"86832389-b959-4be6-add2-26981f4cbd4b","resolution":{"observed_at":"2026-08-08T12:54:56.945488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:56.926218Z","title":null,"venue":null,"work_id":"f18a7643-ce21-4a54-a33a-f9a78924d686","year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.462137Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:4e0bcb066b5f6834359e0d8610b0fc11c90c85e0a68f16e6774931a2d9cdb2dc","observation_id":"34ead312-430b-4a56-b89c-d83a5f1eb0a1","resolution":{"observed_at":"2026-08-08T12:54:56.930849Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:56.911342Z","title":"For example:","venue":null,"work_id":"002f662f-9282-4595-b7f8-e16474060182","year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.465973Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:b211eea118868fd45ce8b32a57da57378188f364cdfcfcccea1baca8abb282ac","observation_id":"6a77d3a1-a090-4eed-89fd-57360faa4222","resolution":{"observed_at":"2026-08-08T12:54:56.916036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:56.896661Z","title":null,"venue":null,"work_id":"3f99f805-c13a-4aba-b268-5e747a343294","year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.470475Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:ae60fa0d66aa7dda12e91b1d32966a91658fc254a2c03b4c7cf47e016e6d11f8","observation_id":"13fb9799-69ef-463f-8e69-265da5d13af4","resolution":{"observed_at":"2026-08-08T12:54:56.901345Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:54:56.881749Z","title":"Unanswerable","venue":null,"work_id":"0019da55-ed2f-4e60-ba4f-01ce74a14cf2","year":null},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.474300Z"},"links":{"citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:f4ccf73bc2f1fa408342355edd2d5e5168b07cbbeee1f8601428c1fec22c884a","observation_id":"c69b76a0-2013-4a16-bcb6-6290905136b1","resolution":{"observed_at":"2026-08-08T12:54:56.886834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T03:53:20.137366Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":1,"verified_fuzzy":42},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 0 inbound Pith citation observations for arXiv:2502.07411."}