{"as_of":"2026-08-09T03:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eb025a94db18baff9c37c8f39b3dce5226d2a755ecbbe4039c03db97ae977bff","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:19:53.982380Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01147/citation-record","integrity":"/paper/2608.01147/integrity","json":"/paper/2608.01147/citation-record.json","paper":"/paper/2608.01147"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T04:19:50.216121Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:50.216121Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:53aefb33fff5d46b07cd4f14597048f3c443bc138cea9ce8bf71065341294cc3","observation_id":"2bb68c95-c171-474b-bdcc-9c007e00ce3f","resolution":{"observed_at":"2026-08-06T04:19:50.216121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:55.544335Z","title":null,"venue":null,"work_id":"5ed90aa4-4ba7-4dd8-a8fb-774ee27c83c0","year":2015},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:50.297578Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:43a328383f5685127ba4f80e1180ff98a34681531bc2b7fbee3f5e6719b395c2","observation_id":"f664837a-2893-42f9-835a-2f28a4495149","resolution":{"observed_at":"2026-08-06T04:19:55.614150Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-06T04:19:50.404693Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:50.404693Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:bf64d11b9daa867937b21bb141c773f20dc395e47e48c0f4eea4ecc95b31f212","observation_id":"f208109c-42c9-4e1d-aa5e-aa01cb540437","resolution":{"observed_at":"2026-08-06T04:19:50.404693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T04:19:50.507547Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:50.507547Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:cf0a5b1fe22fb13ad3226306b71f4dc6153ec852e3254836293251097c3166db","observation_id":"aae32054-007c-4f65-b57a-c0c3a56445cb","resolution":{"observed_at":"2026-08-06T04:19:50.507547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:50.602495Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:50.602495Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:c262b583d801775b3cc0800306975c0b5e4b4f60a1b79835f53b02643a5e865e","observation_id":"25ae2193-bf17-49de-a3d5-cc486e447b7c","resolution":{"observed_at":"2026-08-06T04:19:50.602495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:50.682091Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:50.682091Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:21e624076d40e74a6b4f033e5990d8f48538f2915d3e4d5ff8e932b3cc4c6c55","observation_id":"08af70f6-b402-483c-8af4-fbe7cd2e550a","resolution":{"observed_at":"2026-08-06T04:19:50.682091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-07T03:19:53.953867Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-08-06T04:19:50.895716Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:50.895716Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:c0b6d6d085e745a6fe345d9bb84fe90c0a5d9bc313f33ba98248d06ab46a1be3","observation_id":"10cad550-eafc-443e-b7b9-4b4853ee7ce6","resolution":{"observed_at":"2026-08-06T04:19:50.895716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:50.996226Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:50.996226Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:79d32fcbdfaa0cbd150958df7f803dd62f24097505ac534cf7cabe8aa030f36b","observation_id":"ab2615f7-fdaf-49b7-a3f7-fea5343fe571","resolution":{"observed_at":"2026-08-06T04:19:50.996226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:51.075352Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:51.075352Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:833ca34f8e258a479a04686c49706c0a21337e851f032c547c378a47c91e2aab","observation_id":"06f71d09-dbbf-4a82-b872-08399c5cd30e","resolution":{"observed_at":"2026-08-06T04:19:51.075352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:55.364882Z","title":null,"venue":null,"work_id":"b3507cd5-fe74-41b6-a93e-f1603453a725","year":2025},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:51.154841Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:ec86057b2e7a3279cf26977dcbe92ecebbd2b534f9af36d87f9befa7dfa3a05a","observation_id":"bd99ac77-efa7-4ddf-964f-37586bd0a4d1","resolution":{"observed_at":"2026-08-06T04:19:55.418742Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:51.235201Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:51.235201Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:8cf788a0c04632b6c5aa95783a3d3b97a86226e564c95941b33864e9206d45da","observation_id":"f7f2eeb6-e29e-4841-88dd-afef575d4ebf","resolution":{"observed_at":"2026-08-06T04:19:51.235201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T04:19:51.313452Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:51.313452Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:7f1dd891a8ef8880dc6ef6a092c4928c02d22f2fbfad03ace63dcb56e4a21263","observation_id":"df8ea478-3852-44da-a3f3-567f9f74c712","resolution":{"observed_at":"2026-08-06T04:19:51.313452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T04:19:51.425738Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:51.425738Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:64ef7746b21b5717875092e40474bfc5e09c5d5eb34899a9e47cb9d37be1e0d5","observation_id":"2e9126b8-f1e0-4eba-9538-f71149b6beef","resolution":{"observed_at":"2026-08-06T04:19:51.425738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:51.533409Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:51.533409Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:d2cbab2b4e5d73d5ee2441f25d1bf00edfb2803d951bcf779f157c4f38652e24","observation_id":"5d219da0-b112-48ed-b4e1-3679c49a409f","resolution":{"observed_at":"2026-08-06T04:19:51.533409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:55.239318Z","title":null,"venue":null,"work_id":"7414357a-95bf-4832-9723-aafdd4539a90","year":2023},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:51.669637Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:2f9b00a722bae8ded46b1e4a6b00db1259e0103d16a2a177cd694836f703ac4e","observation_id":"da99ee83-6262-415b-820b-06ae18726929","resolution":{"observed_at":"2026-08-06T04:19:55.280826Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:51.778845Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:51.778845Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:31c9738d833b8b1ebcef6145741f47110a23d2ee7309ef45ae1e718ab0bae19b","observation_id":"3f0ee1a0-4492-418a-9814-741aa9e3a40e","resolution":{"observed_at":"2026-08-06T04:19:51.778845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:51.853909Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:51.853909Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:8b1f12dac40f62efb157c77eac6e10dc93b03ad6cd2018571de136e8d823c97f","observation_id":"7d5196e2-5231-4716-8362-d8c264cad265","resolution":{"observed_at":"2026-08-06T04:19:51.853909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:55.064494Z","title":null,"venue":null,"work_id":"11ea5db2-3739-4acc-a3c1-83db1bbc6d64","year":2023},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:51.951800Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:cea24fdb4496c30bd2220f5b95d6491f97ba5ac430f6541c3757dc499e03cdf7","observation_id":"77659e10-c540-4016-a2eb-9eab808d3cde","resolution":{"observed_at":"2026-08-06T04:19:55.147501Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03809","last_updated":"2022-10-29T10:08:13Z","snapshot_observed_at":"2026-08-05T15:50:39.183704Z","submitted_at":"2022-10-07T20:35:58Z","title":"Retrieval Augmented Visual Question Answering with Outside Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03809","snapshot_observed_at":"2026-08-06T04:19:52.036191Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:52.036191Z"},"links":{"cited_paper":"/paper/2210.03809","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:ab5fc76d37c2a4e9594ee13964faee932425ca881da4d4388e3483a29273b53f","observation_id":"223dbdda-d3e0-441e-80d0-6faf03e1bf5d","resolution":{"observed_at":"2026-08-06T04:19:52.036191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08327","last_updated":"2024-06-05T11:46:23Z","snapshot_observed_at":"2026-08-01T04:05:40.608560Z","submitted_at":"2024-02-13T09:47:07Z","title":"PreFLMR: Scaling Up Fine-Grained Late-Interaction Multi-modal Retrievers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08327","snapshot_observed_at":"2026-08-06T04:19:52.136432Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:52.136432Z"},"links":{"cited_paper":"/paper/2402.08327","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:9cb9928f5590a9f2346b8b8d06abecfdea683efaa91ba592849bc124c6257f5c","observation_id":"584b56d9-b84c-4eb3-b82c-216ad41c9541","resolution":{"observed_at":"2026-08-06T04:19:52.136432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:52.210369Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:52.210369Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:8a7effbb23b76c94ba4baa0da7a6579f7d1b3c17d20180b20de2f3b72e14448d","observation_id":"d64f23e0-d59c-4081-b92e-14bcc7510a24","resolution":{"observed_at":"2026-08-06T04:19:52.210369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:52.314740Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:52.314740Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:9969ef51de7b9d37bd192bf2216592d944da5461e31bfc3e6ff75377b13b0937","observation_id":"0449d530-f874-4807-8f9c-00e4383183d7","resolution":{"observed_at":"2026-08-06T04:19:52.314740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:52.394159Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:52.394159Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:7a275ea6b46b3663a698fa69b6b02a2d50ea782162e2a9c67712ee627457836d","observation_id":"dc7db9c0-5901-4373-a404-3478e071c15d","resolution":{"observed_at":"2026-08-06T04:19:52.394159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.05256","snapshot_observed_at":"2026-08-06T04:19:52.487643Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:52.487643Z"},"links":{"cited_paper":"/paper/2603.05256","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:897a231fa89659a43380d9814a71a1cd59cd895122795400f5d533e2b2a6bd3c","observation_id":"a8d15d2f-478c-4f03-942e-75e496b055cc","resolution":{"observed_at":"2026-08-06T04:19:52.487643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08876","last_updated":"2024-10-14T20:31:13Z","snapshot_observed_at":"2026-08-04T21:17:26.164677Z","submitted_at":"2024-10-11T14:51:00Z","title":"RoRA-VLM: Robust Retrieval-Augmented Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08876","snapshot_observed_at":"2026-08-06T04:19:52.572934Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:52.572934Z"},"links":{"cited_paper":"/paper/2410.08876","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:df5e04b50a0962300fc50b095444db6f7b106279898d6b241dff64b4553e2b9d","observation_id":"060c3c5d-b2e5-4643-8320-93471c8fbb7b","resolution":{"observed_at":"2026-08-06T04:19:52.572934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:54.914374Z","title":null,"venue":null,"work_id":"4e595d81-37d1-4f92-9c85-b73e9424b03b","year":2023},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:52.648108Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:a8a44709ff79922657f47bb48a622ff1a54fa9604936058fd9373a62a1dd4248","observation_id":"b8fdebfc-4d5f-447f-8b7e-a8c4ae5269ab","resolution":{"observed_at":"2026-08-06T04:19:54.962955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-06T04:19:52.727061Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:52.727061Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:3f51df4437cc49b10073fab6b31a362b965267383fb37751214ab033769d8636","observation_id":"afb758eb-e9b6-4e11-a679-a0b77b8f5bcc","resolution":{"observed_at":"2026-08-06T04:19:52.727061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-06T04:19:52.837353Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:52.837353Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:eb8e3c9f91824cf11546575a3eb75567fb77c78d482c814a2aa89e4b741b462b","observation_id":"353c7071-a8c2-4dbc-9acf-c8a45a9ce76c","resolution":{"observed_at":"2026-08-06T04:19:52.837353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T04:19:52.948788Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:52.948788Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:cbf0c086e77c6445401165e3d8ba3a6276b36e518ca26832ec09a3e24022a1aa","observation_id":"73f094df-eb03-46c0-a41f-3a77f4c6c5d0","resolution":{"observed_at":"2026-08-06T04:19:52.948788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:53.028597Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:53.028597Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:e1d55d23a32ad3be93275852eaca29b81cac56caeba58d08deddd3ad94a3bb44","observation_id":"944fb81a-2de3-4908-8c7e-587f23b15e96","resolution":{"observed_at":"2026-08-06T04:19:53.028597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:53.123232Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:53.123232Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:33a201693020d86b74f6c78a613044c83f844914468fe78dd636097cd7336bd5","observation_id":"8d33b20a-8c2e-4174-a437-f8fd38258077","resolution":{"observed_at":"2026-08-06T04:19:53.123232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12735","last_updated":"2024-12-02T02:34:47Z","snapshot_observed_at":"2026-08-05T16:52:46.144105Z","submitted_at":"2024-07-17T16:55:42Z","title":"EchoSight: Advancing Visual-Language Models with Wiki Knowledge","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12735","snapshot_observed_at":"2026-08-06T04:19:53.199025Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:53.199025Z"},"links":{"cited_paper":"/paper/2407.12735","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:e92c1816098baf29336bfddc64cf7d0da8340798c5ec6c11c962a4251c7f93ea","observation_id":"bd2f5435-1540-49da-8431-66d651fd345d","resolution":{"observed_at":"2026-08-06T04:19:53.199025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07879","last_updated":"2025-09-12T11:47:31Z","snapshot_observed_at":"2026-08-07T15:48:13.406477Z","submitted_at":"2025-05-10T14:24:41Z","title":"OMGM: Orchestrate Multiple Granularities and Modalities for Efficient Multimodal Retrieval","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07879","snapshot_observed_at":"2026-08-06T04:19:53.283015Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:53.283015Z"},"links":{"cited_paper":"/paper/2505.07879","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:2d1765eeeed4656f8c5e06d535d7ce5bd7f6367f60b9a7bb9602e27031486101","observation_id":"78da66fd-09d7-4042-91c6-bb593a4a47fe","resolution":{"observed_at":"2026-08-06T04:19:53.283015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:54.783897Z","title":null,"venue":null,"work_id":"3ff182f2-a05f-4c6a-b37b-5909e6692dbf","year":2022},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:53.376192Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:f8a3d20542b457341d541c53814bee69b2e3deefa9346477e9531db829ea9f1c","observation_id":"80bfd994-9173-4ded-aef9-7a2273ef6ea2","resolution":{"observed_at":"2026-08-06T04:19:54.830261Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05318","last_updated":"2026-04-27T09:35:27Z","snapshot_observed_at":"2026-08-02T15:08:55.264024Z","submitted_at":"2025-08-07T12:22:50Z","title":"mKG-RAG: Leveraging Multimodal Knowledge Graphs in Retrieval-Augmented Generation for Knowledge-intensive VQA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05318","snapshot_observed_at":"2026-08-06T04:19:53.513377Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:53.513377Z"},"links":{"cited_paper":"/paper/2508.05318","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:871a895e185f9f7e695337314a46c8431cf3676c882bab2d0a5f6f59285b62da","observation_id":"9d01db48-708a-4a66-bb7f-b4b75c537b31","resolution":{"observed_at":"2026-08-06T04:19:53.513377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-06T04:19:53.647357Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:53.647357Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:be42dd4e2b070db6626343a794ba810419f4421d95dda1fa224c9d93d567c9f2","observation_id":"8cd9d452-1dfa-4da1-b0b7-7df1cef49c02","resolution":{"observed_at":"2026-08-06T04:19:53.647357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-05T15:40:13.091317Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15041","snapshot_observed_at":"2026-08-06T04:19:53.771485Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:53.771485Z"},"links":{"cited_paper":"/paper/2411.15041","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:ca81165ce09c2e44baa469ee75fc6212f4187fbc52dc49eaafdda3b074426f69","observation_id":"90a75562-a2e8-494d-8a15-9392fa7bb123","resolution":{"observed_at":"2026-08-06T04:19:53.771485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04292","last_updated":"2024-06-06T17:37:47Z","snapshot_observed_at":"2026-08-08T20:42:47.396503Z","submitted_at":"2024-06-06T17:37:47Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04292","snapshot_observed_at":"2026-08-06T04:19:53.886239Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:53.886239Z"},"links":{"cited_paper":"/paper/2406.04292","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:20969d2a083c64ecd96ffd261a96b560801c0bf41743205c8de44b3420060ced","observation_id":"cac9af94-b7cd-47cc-baff-5f9517ab36f1","resolution":{"observed_at":"2026-08-06T04:19:53.886239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T04:19:53.982380Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:53.982380Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:aa5deca7b0d46915d9df7220fcdcace04e0cb410b03aef3af996a86e8d19bc2b","observation_id":"8b1d433e-18e6-424a-bb66-51e281d7bd0d","resolution":{"observed_at":"2026-08-06T04:19:53.982380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:50.787024Z","title":"InFindings of the association for computational linguistics: ACL 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:50.787024Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:8a20ac788cf5248ddf6e264ec24185e70c8d5cdab46386583964b3f8c7834acc","observation_id":"3bc49fac-1c75-4c20-be69-4e9ac9b6080f","resolution":{"observed_at":"2026-08-06T04:19:50.787024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","latest_version":2,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-08T23:13:06.648690Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2608.01147."}