{"as_of":"2026-08-10T12:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fc567e75b3f619b2516b8c49f06de5b5d2a395eb8d36e91ace659af8e52252d0","coverage":[{"denominator":114,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:02:30.468386Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T01:49:15.136031Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T16:01:23.018232Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"cited_work":{"arxiv_id":"2506.06279","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06279","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"356ce2fd-c620-457c-b065-3dbf6be01722","year":2025},"citing_paper":{"arxiv_id":"2605.00814","last_updated":"2026-05-08T16:52:48Z","snapshot_observed_at":"2026-07-06T23:14:11.211164Z","submitted_at":"2026-05-01T17:54:37Z","title":"Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-09T18:53:06.494640Z"},"links":{"cited_paper":"/paper/2506.06279","citing_paper":"/paper/2605.00814"},"observation_digest":"sha256:44736b7d5db474dff15045c4c38745064246fc894eb88995c239cd3ad0ae6d9e","observation_id":"141c552d-38db-4546-9c1b-cf0bfe83f149","resolution":{"observed_at":"2026-05-11T16:01:23.021630Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"cited_work":{"arxiv_id":"2506.06279","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06279","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"356ce2fd-c620-457c-b065-3dbf6be01722","year":2025},"citing_paper":{"arxiv_id":"2605.00814","last_updated":"2026-05-08T16:52:48Z","snapshot_observed_at":"2026-07-06T23:14:11.211164Z","submitted_at":"2026-05-01T17:54:37Z","title":"Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-11T01:49:15.136031Z"},"links":{"cited_paper":"/paper/2506.06279","citing_paper":"/paper/2605.00814"},"observation_digest":"sha256:b22e2378852ba04555ed20a485c0035c35a3c774f32cd2c6f79d7ad979660d03","observation_id":"a6c78e64-9adc-4225-94c0-35ecef142c6c","resolution":{"observed_at":"2026-05-11T01:50:51.525657Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.06279/citation-record","integrity":"/paper/2506.06279/integrity","json":"/paper/2506.06279/citation-record.json","paper":"/paper/2506.06279"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.127567Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.127567Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:47cb9ac89bc4cf892b5e302cbd4dae83dd7f71e9e2d7a9f956852d0ed83222f9","observation_id":"79d773ee-f286-40d3-bd8a-4f084176938d","resolution":{"observed_at":"2026-08-07T06:02:30.127567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.132542Z","title":"Nocaps: Novel object captioning at scale","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.132542Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:31b0cdfab425697f0d07db9480d11da563402118e8919b1d2cc26ed7e1fbd32a","observation_id":"1b37105c-5bfe-48d5-a435-308641a2b8b8","resolution":{"observed_at":"2026-08-07T06:02:30.132542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.136019Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.136019Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:6e0d424950d639bf05832bd17be2fe613305596a81e6ee6f03fe4deca981fa21","observation_id":"7646e2aa-2a92-4878-a2de-6d3de73342b7","resolution":{"observed_at":"2026-08-07T06:02:30.136019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13319","last_updated":"2019-05-30T21:28:12Z","snapshot_observed_at":"2026-07-06T07:56:54.143277Z","submitted_at":"2019-05-30T21:28:12Z","title":"MathQA: Towards Interpretable Math Word Problem Solving with Operation-Based Formalisms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13319","snapshot_observed_at":"2026-08-07T06:02:30.139466Z","title":"Mathqa: Towards interpretable math word problem solving with operation-based formalisms","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.139466Z"},"links":{"cited_paper":"/paper/1905.13319","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:b1166c474d5146a6767841856d200185f7649719f89ccc79cfddd3fc9c56aeac","observation_id":"f750bb2f-0dcb-4ec5-bf3c-732c7d48c15b","resolution":{"observed_at":"2026-08-07T06:02:30.139466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.143129Z","title":"A., Datla, V","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.143129Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:f87c16e8e87cdddbfa47040bfbdfcc0950d6b522bd925eb201342a5ae2f0df47","observation_id":"def89704-aae5-45d8-a5ac-d1f50160c601","resolution":{"observed_at":"2026-08-07T06:02:30.143129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.146609Z","title":"F., Tito, R., Mafla, A., Gomez, L., Rusinol, M., Valveny, E., Jawahar, C., and Karatzas, D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.146609Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:75da8e689525878521c647acdfcf625a863e8611f1fad3c6b94813bed2633584","observation_id":"2e30b908-a5a0-41d9-9b70-8ab804a9e781","resolution":{"observed_at":"2026-08-07T06:02:30.146609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.150059Z","title":"Coyo-700m: Image-text pair dataset","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.150059Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:ee72e0d078689d3affa29a707c2efbe6e6e37597d0c866564145e4060c4d60ec","observation_id":"b8d49dac-16a7-4aa6-825c-c39d28fffe1e","resolution":{"observed_at":"2026-08-07T06:02:30.150059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.154200Z","title":"and Xiao, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.154200Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:0713d3036e4e0f63b9816f8fb71016ec81c59962669019f3dd2bb8089075a3f9","observation_id":"8a9ee46c-ef58-4c1f-ae7b-45ef3d6f2469","resolution":{"observed_at":"2026-08-07T06:02:30.154200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.157676Z","title":"Textocr-gpt4v","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.157676Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:f40a4bbce39b6d0cacac1d4083f6001fbfdfabb8a1f145b9e9f4fc2e313e017f","observation_id":"05435e20-be77-4581-9970-3db59625d8a3","resolution":{"observed_at":"2026-08-07T06:02:30.157676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.08545","last_updated":"2022-11-15T22:31:38Z","snapshot_observed_at":"2026-08-09T22:32:24.524992Z","submitted_at":"2022-11-15T22:31:38Z","title":"MapQA: A Dataset for Question Answering on Choropleth Maps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.08545","snapshot_observed_at":"2026-08-07T06:02:30.160890Z","title":"Mapqa: A dataset for question answering on choropleth maps","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.160890Z"},"links":{"cited_paper":"/paper/2211.08545","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:e5b4b0d0f64bd313700899b687e7303866c2e565e8a8021da59b94618d66f6c3","observation_id":"ea0cc5cf-0707-45eb-84f8-9d044095792f","resolution":{"observed_at":"2026-08-07T06:02:30.160890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-07T06:02:30.164986Z","title":"H., Chen, S., Zhang, R., Chen, J., Wu, X., Zhang, Z., Chen, Z., Li, J., Wan, X., and Wang, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.164986Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:c6f82d6875a042083fb06bf88b0487fbf13d67456c2571c496c7bc123df1634a","observation_id":"e07abd60-3b54-47fa-9573-77bf4aa61664","resolution":{"observed_at":"2026-08-07T06:02:30.164986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.02746","last_updated":"2022-12-06T04:37:51Z","snapshot_observed_at":"2026-08-06T05:59:54.593795Z","submitted_at":"2022-12-06T04:37:51Z","title":"UniGeo: Unifying Geometry Logical Reasoning via Reformulating Mathematical Expression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.02746","snapshot_observed_at":"2026-08-07T06:02:30.168722Z","title":"Unigeo: Unifying geometry logical reasoning via reformulating mathematical expression","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.168722Z"},"links":{"cited_paper":"/paper/2212.02746","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:c64ecdb25e81dabd5a283e182dd66f716fa4a256631bc27437d7927c1cf657aa","observation_id":"59f67add-d782-4305-b878-8925ec32c11e","resolution":{"observed_at":"2026-08-07T06:02:30.168722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-07T06:02:30.172306Z","title":"Shikra: Unleashing multimodal llm's referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.172306Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:d8ad3bc6b2cafda4f3c174f054b022957bb2c8f9b6112403ad7e824ee27cd5a1","observation_id":"ae2a3243-366e-4ca9-bc2f-638aae7bf3b1","resolution":{"observed_at":"2026-08-07T06:02:30.172306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14177","last_updated":"2024-07-19T10:09:51Z","snapshot_observed_at":"2026-08-09T15:46:51.929644Z","submitted_at":"2024-07-19T10:09:51Z","title":"EVLM: An Efficient Vision-Language Model for Visual Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14177","snapshot_observed_at":"2026-08-07T06:02:30.175851Z","title":"Evlm: An efficient vision-language model for visual understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.175851Z"},"links":{"cited_paper":"/paper/2407.14177","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:21fd82b769896b8e6493056d7126c8d84b93549147d4b97e357eaa54f4f91f03","observation_id":"aa14a1d1-29be-4aeb-89cf-76468b19416b","resolution":{"observed_at":"2026-08-07T06:02:30.175851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T06:02:30.179318Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.179318Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:86ead4daac642fb7e9e10a1dc610f387c6807602dc05946a1bbeef6489fb05fc","observation_id":"bbc65fc0-80bd-44e0-a9d6-e376db1066f4","resolution":{"observed_at":"2026-08-07T06:02:30.179318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.04729","last_updated":"2019-08-28T16:24:53Z","snapshot_observed_at":"2026-08-10T12:14:32.877990Z","submitted_at":"2019-08-13T16:47:08Z","title":"Complicated Table Structure Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.04729","snapshot_observed_at":"2026-08-07T06:02:30.182794Z","title":"Complicated table structure recognition","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.182794Z"},"links":{"cited_paper":"/paper/1908.04729","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:8ae399c34541c1cdd0ab0282f3cd6db0dd788b85b6501fb460a15bc1f169f07c","observation_id":"de2765e1-0281-4a57-8c39-37fe9e9ebe9e","resolution":{"observed_at":"2026-08-07T06:02:30.182794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.187512Z","title":"K., Liu, Y., Sun, Y., Ng, C","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.187512Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:1bbb133e4b4b9abea839c86c852aefc24dd5831d26aa5810105a2251ded41433","observation_id":"8b42769e-724d-4fc0-9d0c-1b09306a9c0f","resolution":{"observed_at":"2026-08-07T06:02:30.187512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.10723","last_updated":"2017-11-07T18:55:35Z","snapshot_observed_at":"2026-08-09T13:36:00.102461Z","submitted_at":"2017-10-29T23:47:49Z","title":"Simple and Effective Multi-Paragraph Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.10723","snapshot_observed_at":"2026-08-07T06:02:30.190767Z","title":"and Gardner, M","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.190767Z"},"links":{"cited_paper":"/paper/1710.10723","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:44cd73a61a75e8504cc3169ebfd8bed57de9dab47bc9b867216bc4ed4422d663","observation_id":"cd94c8a4-0aba-436e-a7a4-f13cea61dff6","resolution":{"observed_at":"2026-08-07T06:02:30.190767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-07-06T19:17:02.745056Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-08-07T06:02:30.194240Z","title":"Nvlm: Open frontier-class multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.194240Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:cfb0cb5dcd34d150fef8b6171a52c02a66314a24f9e57d4654783542ff4a7b02","observation_id":"33df9bd5-09bf-4ca6-8a80-9c1818466996","resolution":{"observed_at":"2026-08-07T06:02:30.194240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.197809Z","title":"Deep visual template-free form parsing","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.197809Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:5891bc6e12160835eaa60cb17f9ddb7a42173a47d657813bee1b0dd30d08e23e","observation_id":"ff4a96ac-f9d2-4b61-bde0-f07a2c0002e3","resolution":{"observed_at":"2026-08-07T06:02:30.197809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T06:02:30.201168Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.201168Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:a9d2e13e0cd19c81c6bdf125a5e0b002721a7622e7441e1316d9ea8cbe5a6af3","observation_id":"1af4d204-7229-42ac-9f8c-b5f8dca7c0f4","resolution":{"observed_at":"2026-08-07T06:02:30.201168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T06:02:30.204597Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.204597Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:efe3b62ded5a4d4a256d407655786898940c0b1c94bf5ebdc17f607906bf4c53","observation_id":"6ae6ab93-5751-4fb2-98a7-9ddc968e5796","resolution":{"observed_at":"2026-08-07T06:02:30.204597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.208209Z","title":"A., Ma, W.-C., and Krishna, R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.208209Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:a7329a27ead0be92e25cac9fe9900420c544c2b1aeb88cf045e059c50ee042ca","observation_id":"763727de-789a-4026-a5f0-6c930777ce2c","resolution":{"observed_at":"2026-08-07T06:02:30.208209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.211435Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.211435Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:6ac900b369170b4a6d390f35c06c4e1ad16af946ad44361e80da05dcd7565934","observation_id":"4544efaf-0813-4a67-9ba4-cbd5ad03d612","resolution":{"observed_at":"2026-08-07T06:02:30.211435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.214909Z","title":"Wukong: A 100 million large-scale chinese cross-modal pre-training benchmark","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.214909Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:e718050c0a45c693d6383842b56f7e54df54b9c297a65da0502c7f5c766aeb81","observation_id":"12fc4599-f778-4b46-a339-87cc2d6b3369","resolution":{"observed_at":"2026-08-07T06:02:30.214909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.218140Z","title":"Eaten: Entity-aware attention for single shot visual text extraction","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.218140Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:1ccb1bbfb9c1061e1649b5a0a3cf7d3b324ef1b0c01b39d639d5a158d91b3f43","observation_id":"52e019b4-ae1e-4d76-a27d-ed70e62f19f6","resolution":{"observed_at":"2026-08-07T06:02:30.218140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.221368Z","title":"Icpr2018 contest on robust reading for multi-type web images","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.221368Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:9906a7b011f78babef709e18846cf3e1cce84936cd43f1d56718fe8d2be7f429","observation_id":"2430febf-ee02-49cd-b57f-6ac84cc8b47f","resolution":{"observed_at":"2026-08-07T06:02:30.221368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.10286","last_updated":"2020-03-07T17:55:41Z","snapshot_observed_at":"2026-07-06T09:06:42.071993Z","submitted_at":"2020-03-07T17:55:41Z","title":"PathVQA: 30000+ Questions for Medical Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.10286","snapshot_observed_at":"2026-08-07T06:02:30.224674Z","title":"Pathvqa: 30000+ questions for medical visual question answering","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.224674Z"},"links":{"cited_paper":"/paper/2003.10286","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:5b8d40c10ac228b6db69ebf764499504c6836d1e86c36433d0d7856085dcb9ff","observation_id":"209f2471-82e4-450e-8fe7-45bb600d254e","resolution":{"observed_at":"2026-08-07T06:02:30.224674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.228260Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.228260Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:6fba5f0a9d11f964b57730bbe03a0398635957f41b1250b59763ce318e895106","observation_id":"669db1a4-b54e-49e4-8bfe-4d8b997731fb","resolution":{"observed_at":"2026-08-07T06:02:30.228260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.231512Z","title":"Koniq-10k: An ecologically valid database for deep learning of blind image quality assessment","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.231512Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:0c79eb19a8a5e12e090a199431455ca8bf2d2fdcabce03b82b36634a4f4484b6","observation_id":"6ca98ae8-e705-436f-9692-368ec67430e2","resolution":{"observed_at":"2026-08-07T06:02:30.231512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12895","last_updated":"2024-03-19T16:48:40Z","snapshot_observed_at":"2026-08-07T02:52:27.054968Z","submitted_at":"2024-03-19T16:48:40Z","title":"mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12895","snapshot_observed_at":"2026-08-07T06:02:30.234729Z","title":"mplug-docowl 1.5: Unified structure learning for ocr-free document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.234729Z"},"links":{"cited_paper":"/paper/2403.12895","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:c0c38167789ddfe53f652155acaffbcce55bb6d72a98dbb3cd4e4e7c93b2f08d","observation_id":"13ce348c-6f4e-4ff0-a75c-36eed2ec4bee","resolution":{"observed_at":"2026-08-07T06:02:30.234729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.238109Z","title":"Medical-diff-vqa: a large-scale medical dataset for difference visual question answering on chest x-ray images, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.238109Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:419bd08022ea150d23440fc00ce27d6eaba0bf7a0f766fd818da97148cc76f30","observation_id":"8c75405c-2f20-4413-a079-1700b6a00b72","resolution":{"observed_at":"2026-08-07T06:02:30.238109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.241444Z","title":"Movienet: A holistic dataset for movie understanding","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.241444Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:2bc8d5f6490633fc4cf2821036bc78d600b381279c5f3626a1e41822de20f7ca","observation_id":"beed86e7-8ef0-4c38-b874-721f76f683c1","resolution":{"observed_at":"2026-08-07T06:02:30.241444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.244739Z","title":"Icdar2019 competition on scanned receipt ocr and information extraction","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.244739Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:0516821eb7279d56f5e1f53479690fe85478bc052a3c8fcddc1a34939fc03ff6","observation_id":"a3283491-6cde-4272-a8e9-6a8b47581690","resolution":{"observed_at":"2026-08-07T06:02:30.244739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.247942Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.247942Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:3877b0e3d6b1bae2d1ea7876f100e2bd8689dd9cb4255963e06c06a6e8acc0bd","observation_id":"4dfa8682-7aa0-4224-8ea3-1847b10f9a60","resolution":{"observed_at":"2026-08-07T06:02:30.247942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-07T06:02:30.251165Z","title":"Mantis: Interleaved multi-image instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.251165Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:c3dafaecf2220d26cd167660278ac779ce4971128174875fae2471b9a5b0f9d1","observation_id":"174f77cd-8052-47e7-9770-9eba5b8372c6","resolution":{"observed_at":"2026-08-07T06:02:30.251165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.254523Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.254523Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:81ee9c8ad70dcc844ae2b8436b78a10209a10d861f17b2a904e6ad7812b544b3","observation_id":"80d25d45-dc03-4fc4-a455-9dc0d7bf3c4c","resolution":{"observed_at":"2026-08-07T06:02:30.254523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.258111Z","title":"Dvqa: Understanding data visualizations via question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.258111Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:a6bdf9e05dfe98b28f325e794d4a62ba6f8c4f91566619ba9ec554524990b130","observation_id":"b5cdb447-51fa-47f8-a580-c592747f2c7e","resolution":{"observed_at":"2026-08-07T06:02:30.258111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.07300","last_updated":"2018-02-22T22:50:42Z","snapshot_observed_at":"2026-08-04T06:17:25.388464Z","submitted_at":"2017-10-19T18:01:38Z","title":"FigureQA: An Annotated Figure Dataset for Visual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.07300","snapshot_observed_at":"2026-08-07T06:02:30.261341Z","title":"E., Michalski, V., Atkinson, A., K \\'a d \\'a r, \\'A ., Trischler, A., and Bengio, Y","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.261341Z"},"links":{"cited_paper":"/paper/1710.07300","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:32fafb04fa81c2982d3be652db4ad1e942c7f14eafae01e380f868dbba8f7bf8","observation_id":"d8be9ef5-2188-4f56-a41a-7957667c4179","resolution":{"observed_at":"2026-08-07T06:02:30.261341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06486","last_updated":"2022-04-14T15:41:15Z","snapshot_observed_at":"2026-07-06T12:47:09.813767Z","submitted_at":"2022-03-12T17:01:38Z","title":"Chart-to-Text: A Large-Scale Benchmark for Chart Summarization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.06486","snapshot_observed_at":"2026-08-07T06:02:30.264586Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.264586Z"},"links":{"cited_paper":"/paper/2203.06486","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:b5a2c0bbdd2bc72c2302addd558e1833d8e867e97f431bec3101e756c6184d2f","observation_id":"c1474023-82b6-4b32-be90-265dbf797445","resolution":{"observed_at":"2026-08-07T06:02:30.264586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.268275Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.268275Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:0b211ac6491293b8938044d12926648de47b60c83188338ac806e06913fb1e12","observation_id":"8277c4b0-01fe-4f01-b02a-6ea0cf332505","resolution":{"observed_at":"2026-08-07T06:02:30.268275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.271379Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.271379Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:d70d8d2aa6eb9772dae9ad651e7546f2028d044c7bdbc67015a5341a9cf1d43e","observation_id":"8f63e000-09da-4d75-827b-ff1de325a7e9","resolution":{"observed_at":"2026-08-07T06:02:30.271379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.274553Z","title":"Are you smarter than a sixth grader? textbook question answering for multimodal machine comprehension","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.274553Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:a24ce523087088d7148c7b0e260865b70cc2a9d959d424df8950e5d9a33228ef","observation_id":"f1cc699c-fcae-4550-87ec-cf8c16069995","resolution":{"observed_at":"2026-08-07T06:02:30.274553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.278069Z","title":"Visual information extraction in the wild: practical dataset and end-to-end solution","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.278069Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:35af12e2148e68f70d21fe109691f816693aa3c1d0a69aa3a369fb7e8984ab74","observation_id":"57ad395e-beeb-4c37-a87b-ed1205ca2522","resolution":{"observed_at":"2026-08-07T06:02:30.278069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.281255Z","title":"Laion-gpt4v dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.281255Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:d71c35e0a825cf1c3a2881e1c35d26fbeb6f5e1842a8f7c1ad64e458b421035e","observation_id":"810c6589-e670-4112-a806-0b314790c112","resolution":{"observed_at":"2026-08-07T06:02:30.281255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.284375Z","title":"J., Gayen, S., Ben Abacha, A., and Demner-Fushman, D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.284375Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:36f801c80bb494ff4f9221bc622a6177913a1a6668fa23a0c772debffc5f5ee1","observation_id":"dfc59059-e7aa-4d95-a722-6d38b63e3d24","resolution":{"observed_at":"2026-08-07T06:02:30.284375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-08T17:33:57.727194Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-07T06:02:30.287592Z","title":"What matters when building vision-language models? arXiv preprint arXiv:2405.02246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.287592Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:8b3527081763f68d4ad125a1b512682fc914a0d952a87c464343bff0c64d026d","observation_id":"9a24351c-1ad4-46be-9297-e4b072587cfb","resolution":{"observed_at":"2026-08-07T06:02:30.287592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.290994Z","title":"G., and Lov \\'o n Melgarejo, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.290994Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:efe5143f069f0524add9c138cf57dcf2803f168c9d411e45366ec69bd5a8b640","observation_id":"cc7246f4-6e8f-4389-a348-e5da0dbb0458","resolution":{"observed_at":"2026-08-07T06:02:30.290994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.294273Z","title":"Chemvlm: Exploring the power of multimodal large language models in chemistry area","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.294273Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:5648f4883174d6ae15ec8799795d46f41aad0a7c4e7c0ebffd7e9b833236c306","observation_id":"36f591ec-7866-4929-8473-e3c6ff0d02ff","resolution":{"observed_at":"2026-08-07T06:02:30.294273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.297412Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.297412Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:2bb7c549d6e14d59ba90e333befa95ce51ef8914d973bab5b5378d53d4c5208e","observation_id":"9322a4e8-564e-40c4-a543-064dc566e5e2","resolution":{"observed_at":"2026-08-07T06:02:30.297412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.300577Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.300577Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:fb05eadb17395c3331e1d693ffae02a4f0371a18e5b96f5c91180131c07adf91","observation_id":"dd1e125a-4572-4e4e-b84a-48a5cf860a21","resolution":{"observed_at":"2026-08-07T06:02:30.300577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.303815Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.303815Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:2d17ac9a5ff61a95611c4d696dcc80a28587c6015609bf35c555cce55822a8c1","observation_id":"0efdde03-aabb-4c5e-9981-273822210940","resolution":{"observed_at":"2026-08-07T06:02:30.303815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.307014Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.307014Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:cd3b8feea9ed049395bd81afc04589b89f056800ff38c98f3e91dc17effafe17","observation_id":"01704a5f-c125-49bc-881a-eb17e9f8b86c","resolution":{"observed_at":"2026-08-07T06:02:30.307014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.514606Z","title":"Slake: A semantically-labeled knowledge-enhanced dataset for medical visual question answering","venue":null,"work_id":"786ed2d1-09da-40a8-af16-4bc638778063","year":2021},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.310104Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:2956d77445fca315ad8981e60c5e6ba821ae4c9f29622e72ed493f5c7a4d93d7","observation_id":"99dea663-00ac-46ea-babb-7b35d882486d","resolution":{"observed_at":"2026-08-07T06:02:31.518169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.503003Z","title":"Casia online and offline chinese handwriting databases","venue":null,"work_id":"0c99d457-1914-4119-86f8-d65f80365e8e","year":2011},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.313225Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:8c2232e6953f2fb4ad1ab3348d14a6b504d2d27ece12c19a7fbc6ad6d1b93f57","observation_id":"b189077f-4b5e-4840-ad8e-bea1bbe31d7d","resolution":{"observed_at":"2026-08-07T06:02:31.506657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.491725Z","title":"Visual spatial reasoning","venue":null,"work_id":"9bb29477-c597-46e9-ae42-543b8afbac1d","year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.316435Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:6cf821590df72c981ce9869a81228d66163ddae6a2bc00e6b0470211505df30a","observation_id":"946e01d2-f093-45ca-a824-c0bf5ccc3cc5","resolution":{"observed_at":"2026-08-07T06:02:31.495266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.480317Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning","venue":null,"work_id":"c52cabba-f43d-4703-b5fe-eae6f6916979","year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.319716Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:a4302602984a8287becfa489d318508d9dd3e17bec8a01cc601efd559cb6cb83","observation_id":"b07f0ca7-744d-4623-b1e8-e0f98c805451","resolution":{"observed_at":"2026-08-07T06:02:31.484152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10774","last_updated":"2024-04-15T15:48:48Z","snapshot_observed_at":"2026-07-06T16:49:13.099946Z","submitted_at":"2023-11-15T23:36:42Z","title":"MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10774","snapshot_observed_at":"2026-08-07T06:02:30.322925Z","title":"Mmc: Advancing multimodal chart understanding with large-scale instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.322925Z"},"links":{"cited_paper":"/paper/2311.10774","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:f7aa986ff4e34afefaa0101306bb71013f71604468a1e1b58d6cbb985e89f619","observation_id":"17c71ad7-9f4f-4159-9ce9-1a6764bd694f","resolution":{"observed_at":"2026-08-07T06:02:30.322925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.326278Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.326278Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:0f3a1814297b2a9606c20ebc75187ed8d5c35fec1f73286b581dc8560d1beef2","observation_id":"f00e6b2e-9063-4c1a-8cd1-2a7c6a92d1a5","resolution":{"observed_at":"2026-08-07T06:02:30.326278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.329367Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.329367Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:5c019f7aed51000f4ee3a8cd8b9d053d3a1f90b4f2dc30f7d02c734180618fdb","observation_id":"604930f5-0b88-4c59-95d0-1ee410d9de32","resolution":{"observed_at":"2026-08-07T06:02:30.329367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.332532Z","title":"F., Lin, K., Hewitt, J., Paranjape, A., Bevilacqua, M., Petroni, F., and Liang, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.332532Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:b483490c2603ac359e073ade09523d575d96c0aeddeb86ea19fcd232bcfbed85","observation_id":"8546b904-8a57-41ab-a652-42fed20649b7","resolution":{"observed_at":"2026-08-07T06:02:30.332532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.445353Z","title":"Paying more attention to image: A training-free method for alleviating hallucination in lvlms","venue":null,"work_id":"38b0c047-7353-48be-b84d-23ba801100ea","year":2025},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.335865Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:696472bccbe1d851f3930ba2779448c76be60d88a2a1be1368f270b815a7691e","observation_id":"90241c51-b471-4207-a6b0-416a39b7b9e8","resolution":{"observed_at":"2026-08-07T06:02:31.449278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.339582Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pp.\\ 216--233","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.339582Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:4285829d146c68d8bf40867a301bcaf37a790aea32b58abc8aefe5bd3d550220","observation_id":"733505ed-4a4d-490f-9430-7783d7a73374","resolution":{"observed_at":"2026-08-07T06:02:30.339582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11833","last_updated":"2024-10-29T12:34:11Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:47Z","title":"MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11833","snapshot_observed_at":"2026-08-07T06:02:30.346839Z","title":"Mmdu: A multi-turn multi-image dialog understanding benchmark and instruction-tuning dataset for lvlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.346839Z"},"links":{"cited_paper":"/paper/2406.11833","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:5d1900551b986b04eca389f8294e34a56d358cd26de8cba5906c4f54257c0bdb","observation_id":"5695cc77-06fc-4aca-a66e-e9a988521821","resolution":{"observed_at":"2026-08-07T06:02:30.346839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04165","last_updated":"2021-07-20T23:22:27Z","snapshot_observed_at":"2026-08-06T13:29:31.050456Z","submitted_at":"2021-05-10T07:46:55Z","title":"Inter-GPS: Interpretable Geometry Problem Solving with Formal Language and Symbolic Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04165","snapshot_observed_at":"2026-08-07T06:02:30.350057Z","title":"Inter-gps: Interpretable geometry problem solving with formal language and symbolic reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.350057Z"},"links":{"cited_paper":"/paper/2105.04165","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:794b51789a425853da3e1f0d935cc55f50ac089d878d19ec919ad1a5b0c23aa8","observation_id":"e3b3ff6b-8025-4c8a-98d7-14cdf5e688b2","resolution":{"observed_at":"2026-08-07T06:02:30.350057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.425713Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"ae537505-d0ce-4411-87db-8db680d54728","year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.353502Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:537d00700967f6e9950382dadfa2d22936e96c9ce1aa0ba38234eaed048dd066","observation_id":"6e92e147-407f-4e5b-8b8f-1e49ef1e8d61","resolution":{"observed_at":"2026-08-07T06:02:31.429290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-08T00:29:35.147198Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-07T06:02:30.357233Z","title":"N., Zhu, S.-C., Rajpurohit, T., Clark, P., and Kalyan, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.357233Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:c4d8d6595db985c7023529392e42beec3525747dda8412980116cccec0316037","observation_id":"4f30c604-bac2-41b0-9774-f0e2832b62cd","resolution":{"observed_at":"2026-08-07T06:02:30.357233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T06:02:30.361051Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.361051Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:efeb1f391b6ceb84ac39b400707badde855f28f173c65e980fdb81c7b07a37e7","observation_id":"156f6993-0a26-418b-bb6f-867c05b90e02","resolution":{"observed_at":"2026-08-07T06:02:30.361051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.414662Z","title":"Deepart: Learning joint representations of visual arts","venue":null,"work_id":"9935870a-01de-4115-8d5d-de5230746172","year":2017},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.364523Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:4b9e7a85dfb197a5bcb1210f8b09c96aba6832fe2583f74a1c070f84d0d0782a","observation_id":"f661c154-e39b-42b0-980a-4f0457f3041a","resolution":{"observed_at":"2026-08-07T06:02:31.418177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.402410Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"f3185ee2-ad9e-4dec-ac08-c398190e3032","year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.367657Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:ee6c299985b777e1ec5555be2345557b08c82c8e03cc4cc292cb988f900fc7c2","observation_id":"c77c4483-ffa4-4447-b75b-c3042ff0f6a1","resolution":{"observed_at":"2026-08-07T06:02:31.406702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.390637Z","title":"and Bunke, H","venue":null,"work_id":"a02934d4-d6cc-4f9c-a227-16d33eb5aae2","year":2002},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.370785Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:ed0a20767a70e56af5bf244ff7f42a6578d5d50f8d2513c8b53bd32d78d1b202","observation_id":"dfa4350b-4f3c-46ca-9875-93bcd26166eb","resolution":{"observed_at":"2026-08-07T06:02:31.394019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.379221Z","title":"L., Tan, J","venue":null,"work_id":"5c5acaea-ee4c-4f17-9b24-0114d5128ce0","year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.374097Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:7a0f9f07ea1c468002149df9b97c60b518a687fe986a3cdc193d312588c39fc0","observation_id":"18c6213e-1545-47cb-916a-ab4fe68274be","resolution":{"observed_at":"2026-08-07T06:02:31.382660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-07T06:02:30.377251Z","title":"X., Tan, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.377251Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:9536d46d5b2cb6e55da1d4019f15fa5d38a558d5d6923527085989702884601b","observation_id":"137e982f-9a0d-49a5-8a9e-134d0c8a0659","resolution":{"observed_at":"2026-08-07T06:02:30.377251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14761","last_updated":"2023-10-10T23:39:25Z","snapshot_observed_at":"2026-08-03T20:34:57.164411Z","submitted_at":"2023-05-24T06:11:17Z","title":"UniChart: A Universal Vision-language Pretrained Model for Chart Comprehension and Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14761","snapshot_observed_at":"2026-08-07T06:02:30.380654Z","title":"L., Hoque, E., and Joty, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.380654Z"},"links":{"cited_paper":"/paper/2305.14761","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:cc85775c230d885cd5ee65dd9550f03ce5beb798415d8af639a398b66817a098","observation_id":"be2f4648-53c9-4e91-8ab0-fc059295805c","resolution":{"observed_at":"2026-08-07T06:02:30.380654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.367846Z","title":"Infographicvqa","venue":null,"work_id":"621cff0e-0ab4-413f-8c3c-5d095b13bebc","year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.384119Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:3215940634a4b3809e7d8f34d7db9f42b5df832f974e67ecd49ee182f5e668cb","observation_id":"e6bcc7c4-897b-429b-ad41-109aa8beff90","resolution":{"observed_at":"2026-08-07T06:02:31.371284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.356383Z","title":"M., and Kumar, P","venue":null,"work_id":"d6c8671f-ad58-4a5a-8944-8b3472f605e7","year":2020},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.387472Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:deaa49db5e6481b63a7283f5471e02712225f456e491e5d2c83976863b81ee12","observation_id":"9ff00e35-d786-456c-8814-5f0078660c84","resolution":{"observed_at":"2026-08-07T06:02:31.360029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.344998Z","title":"Opengvlab/internvl-chat-v1-2-sft-data, Jan 2024","venue":null,"work_id":"9c0f117a-7bc8-43ca-aa5a-df41b06cd9fb","year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.391046Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:cc314036a4efa2a4e07e53010413263208ea7095f5f7c19ed514ec0b041cc2c3","observation_id":"3ecfc09d-1ebb-4353-a622-1da18e7a13fe","resolution":{"observed_at":"2026-08-07T06:02:31.348665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:30.394227Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.394227Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:f5d1f1e23f4428eda00049fcd45b45a9cec929e1d23e82453393f5b0e44168f0","observation_id":"63479621-6e1a-4838-8694-93568d5fa6e7","resolution":{"observed_at":"2026-08-07T06:02:30.394227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-07T06:02:30.397502Z","title":"Kosmos-2: Grounding multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.397502Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:165de59df8c81d12504ad56fa92710637ec9ef59aceafae44e5844820673c8e5","observation_id":"0c1e3acc-6270-4b13-aa75-e1b031b50306","resolution":{"observed_at":"2026-08-07T06:02:30.397502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.326123Z","title":"A., Wang, L., Cervantes, C","venue":null,"work_id":"91a87fe3-e19e-4f3e-b10f-0cad9b2da27c","year":2015},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.400986Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:226aca9e7ee5870de70de060337fdab82bc538ce1f722bf44ed81147444e96ba","observation_id":"01a410e3-8cf4-4fae-b973-5d36686e14b5","resolution":{"observed_at":"2026-08-07T06:02:31.329398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.315097Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"df4f3d23-11b9-4d3c-8647-3bda54a528eb","year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.404242Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:3d9fc836d8aa603c95c154be91310c11e1dd191354700102ed20eca20bd12a59","observation_id":"1cc2ab6b-5754-4d27-8241-182a2418c82a","resolution":{"observed_at":"2026-08-07T06:02:31.318852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.304208Z","title":"Laion coco: 600m synthetic captions from laion2b-en","venue":null,"work_id":"df241a70-6744-407d-8854-792d01f8e648","year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.407507Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:3588855a53cf0234c7fb1d5ebacdf3d3e90af0373767f3d0b9e18340b5eabcf5","observation_id":"bb4b8522-8214-418c-a2ff-1c533289bb58","resolution":{"observed_at":"2026-08-07T06:02:31.307704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.293234Z","title":"Solving geometry problems: Combining text and diagram interpretation","venue":null,"work_id":"3f650c38-6204-4690-bac3-39521c79aadb","year":2015},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.410789Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:53030bd6ee550f73729230f5cb16afa75a34a6746f077bbff8565e9593780fdd","observation_id":"1b84a50c-ef90-4ba9-bdef-b3783f87e3ad","resolution":{"observed_at":"2026-08-07T06:02:31.296729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.282314Z","title":null,"venue":null,"work_id":"374a4802-02a6-4776-b3ae-27e4ec3e6110","year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.414053Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:a18fbe7b20f918494aa7cb8c0db7e0a0560f90c9d9629554fabde3e1a9343ea1","observation_id":"fbe9a7b8-59c9-41b3-99d9-a4dfb01ad904","resolution":{"observed_at":"2026-08-07T06:02:31.285582Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.271535Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":"02bad084-ce26-4590-8f32-3bbd86677e09","year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.417252Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:a47711a5e713dc202b5aea0ffebf65aebdbe16852c0cddffd909ff08eb8e1536","observation_id":"1a3ad93e-ed8e-4a09-9d05-0bf9b7515aec","resolution":{"observed_at":"2026-08-07T06:02:31.274988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.260932Z","title":"Towards vqa models that can read","venue":null,"work_id":"b45a31dc-17d0-4c97-bb1d-1faaab5b5232","year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.420406Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:35a4875f8c8b315c66a98ba44e03890a1c31b886e1b49ac095ab2c2872fa5c6b","observation_id":"0a2e401d-22de-4408-b203-8ce576a0d7e5","resolution":{"observed_at":"2026-08-07T06:02:31.264334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.248893Z","title":"Towards vqa models that can read","venue":null,"work_id":"665a23f0-d566-497e-8760-b8c933a9554a","year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.423527Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:90a2452e342bc3b246bc7230a867ea56ced991e2d37bc1b2eef0bdeaefc9be37","observation_id":"be159f74-34f0-4efd-9ca0-9bfb09e11a71","resolution":{"observed_at":"2026-08-07T06:02:31.252411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.237712Z","title":"Textocr: Towards large-scale end-to-end reasoning for arbitrary-shaped scene text","venue":null,"work_id":"1e170b86-1dc7-4853-b58e-510f8b96b9dd","year":2021},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.426830Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:6df406df5fc38e41798234f41cd18844ef0e69ed416d37ec7a0b04db3386badf","observation_id":"3179f98c-0cf1-44ad-ab44-ee10b2d0dbce","resolution":{"observed_at":"2026-08-07T06:02:31.241606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18532","last_updated":"2024-05-15T05:43:30Z","snapshot_observed_at":"2026-08-04T01:28:52.686106Z","submitted_at":"2024-04-29T09:19:05Z","title":"MileBench: Benchmarking MLLMs in Long Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18532","snapshot_observed_at":"2026-08-07T06:02:30.430076Z","title":"H., Yu, F., Wan, X., and Wang, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.430076Z"},"links":{"cited_paper":"/paper/2404.18532","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:22a84f7b873a7d59ae6cb855a9c254ad2f1448937e73fca730a1d1b8fc1c7a43","observation_id":"d554ce3f-0191-4126-aca7-caf3d993cddc","resolution":{"observed_at":"2026-08-07T06:02:30.430076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.226252Z","title":"Transformer roadmap: 2","venue":null,"work_id":"a79c7634-60c8-4f65-84b9-9585b740b716","year":2021},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.433564Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:f08b78526fe0f670abd18f1ec1db17bb623ab26b19e8d90386328e9f05c7f710","observation_id":"15374b95-0c4e-410f-af9a-b0853b967627","resolution":{"observed_at":"2026-08-07T06:02:31.229796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.215251Z","title":"C., Han, J., Ding, E., Liu, J., Karatzas, D., et al","venue":null,"work_id":"646abf04-20e8-47b1-9e8a-81394cbfd009","year":2019},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.436705Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:a7a0f3e58dcc5b02ef7c0cdc488e2e6d5478b0a1786fd26f2ba2f1cfb81035bf","observation_id":"9d98cf6c-e5e3-4c5c-980b-b5d1a4852d4f","resolution":{"observed_at":"2026-08-07T06:02:31.218537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.204213Z","title":"Internvl2: Better than the best—expanding performance boundaries of open-source multimodal models with the progressive scaling strategy, 2024","venue":null,"work_id":"eeec05a5-d758-4042-bbd9-3e80035b41dd","year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.439836Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:3d8824717d7fd39ea406414da37aea8e44ff0ae294b2bac1ff016232663001b4","observation_id":"18ec7216-01ed-42d5-85ed-341a4c6cd833","resolution":{"observed_at":"2026-08-07T06:02:31.207757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T06:02:30.444417Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.444417Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:54be00465943552b8fdb3bc92b298d606c4e0c45d2f7d75367710db45d17c478","observation_id":"295ed525-12db-4af6-bcb7-6dfc706f61ef","resolution":{"observed_at":"2026-08-07T06:02:30.444417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-08-07T06:02:30.447765Z","title":"Coco-text: Dataset and benchmark for text detection and recognition in natural images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.447765Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:2bbc3b2ffc223975917ef57a1da84c9fd8c8eb66b5727dade50a7c865e9f2d08","observation_id":"a1f5b464-6f14-461f-aedd-9d6cbb42dc60","resolution":{"observed_at":"2026-08-07T06:02:30.447765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.193178Z","title":"V3det: Vast vocabulary visual detection dataset","venue":null,"work_id":"ddab95d8-3c16-4f06-b5de-8dfc263883e0","year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.451246Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:5c5f40ebcf7f93eed5d17c43826abdb9c252de7013626e438f3ce1a344fa2421","observation_id":"9f93a81d-03ac-4199-8d57-73741ee9121c","resolution":{"observed_at":"2026-08-07T06:02:31.196589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14804","last_updated":"2024-02-22T18:56:38Z","snapshot_observed_at":"2026-08-08T13:47:36.585273Z","submitted_at":"2024-02-22T18:56:38Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14804","snapshot_observed_at":"2026-08-07T06:02:30.454664Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.454664Z"},"links":{"cited_paper":"/paper/2402.14804","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:4eb1b25c7ad28502ec2f1ae752234ba93329700229a6cdcca93c79fcbdc05339","observation_id":"ae545fb5-9c31-4421-9b57-625e6aeba795","resolution":{"observed_at":"2026-08-07T06:02:30.454664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T06:02:30.458205Z","title":"Qwen2-vl: Enhancing vision-language model's perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.458205Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:22c6b696602489e1939e3db5c0133f87492622d2d8ae5614fae41f77f6238f39","observation_id":"6c69544c-f78e-4907-bb82-9e20ca304583","resolution":{"observed_at":"2026-08-07T06:02:30.458205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01907","last_updated":"2023-08-03T17:59:47Z","snapshot_observed_at":"2026-07-06T16:02:15.266899Z","submitted_at":"2023-08-03T17:59:47Z","title":"The All-Seeing Project: Towards Panoptic Visual Recognition and Understanding of the Open World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01907","snapshot_observed_at":"2026-08-07T06:02:30.461439Z","title":"The all-seeing project: Towards panoptic visual recognition and understanding of the open world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.461439Z"},"links":{"cited_paper":"/paper/2308.01907","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:43e455b46841fe29c640b2074779ff1c7d665a4c57f7d3453adf056a28dd00ea","observation_id":"74ab545b-117c-4047-824a-57ee643cddd5","resolution":{"observed_at":"2026-08-07T06:02:30.461439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07230","last_updated":"2024-10-09T07:46:02Z","snapshot_observed_at":"2026-07-06T18:28:51.180903Z","submitted_at":"2024-06-11T13:09:16Z","title":"Needle In A Multimodal Haystack","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07230","snapshot_observed_at":"2026-08-07T06:02:30.464875Z","title":"Needle in a multimodal haystack","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.464875Z"},"links":{"cited_paper":"/paper/2406.07230","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:0d57f91d2661c981d5b3bd7347c1179358cb156962fe0132dbdbec0615bcb797","observation_id":"4f7dfd5e-5b7a-4f5b-90cb-ac18b352031d","resolution":{"observed_at":"2026-08-07T06:02:30.464875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:31.181035Z","title":"C., Luo, C., Jin, L., Chan, C","venue":null,"work_id":"091b5e9a-4942-4046-9005-170fbf9c781b","year":2020},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.468386Z"},"links":{"citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:fcb8d91e7ca00bf14313aee0c1c05ec7d35e7ffcf3f334d0415fec3ab4fec620","observation_id":"60177022-5d53-47f2-baf6-075177bef644","resolution":{"observed_at":"2026-08-07T06:02:31.184921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":74,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":114},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 114 outbound references and 2 inbound Pith citation observations for arXiv:2506.06279."}