{"as_of":"2026-08-17T02:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:10631a09516aa88e43d485dc3a117d64826733bc35332344075363c6a776adfa","coverage":[{"denominator":119,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T12:46:59.931076Z","state":"measured"},{"denominator":109,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":109,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:39:35.380728Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T09:43:00.317941Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13871","snapshot_observed_at":"2026-08-10T20:39:35.380728Z","title":"Llava-uhd v2: an mllm integrating high-resolution feature pyramid via hierarchical window transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07783","last_updated":"2025-01-14T01:57:41Z","snapshot_observed_at":"2026-08-16T21:00:42.878558Z","submitted_at":"2025-01-14T01:57:41Z","title":"Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:35.380728Z"},"links":{"cited_paper":"/paper/2412.13871","citing_paper":"/paper/2501.07783"},"observation_digest":"sha256:0109a10cce54875cf97bd003c5c006b26445c07545ded6a41daa5b1b21a9744f","observation_id":"73a88199-3b83-4783-b056-416ef5d6628f","resolution":{"observed_at":"2026-08-10T20:39:35.380728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"cited_work":{"arxiv_id":"2412.13871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13871","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-uhd v2: an mllm integrating high-resolution feature pyramid via hierarchical window transformer","venue":null,"work_id":"99f23a8d-c38f-4037-9d5f-a08d8e258fdc","year":2024},"citing_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T09:43:00.208065Z"},"links":{"cited_paper":"/paper/2412.13871","citing_paper":"/paper/2503.21776"},"observation_digest":"sha256:71f2e8ee7e2f4aec1c623df9a310d0fc7004ec5c4e071c57f709a6316af55f4b","observation_id":"534df0bd-a894-4c44-9e34-44b76cf1d0db","resolution":{"observed_at":"2026-05-12T09:43:00.321276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13871","snapshot_observed_at":"2026-08-07T12:22:12.643287Z","title":"Llava-uhd v2: an mllm integrating high-resolution feature pyramid via hierarchical window transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24718","last_updated":"2025-06-08T14:43:47Z","snapshot_observed_at":"2026-08-14T19:57:36.845039Z","submitted_at":"2025-05-30T15:42:19Z","title":"Reinforcing Video Reasoning with Focused Thinking","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:12.643287Z"},"links":{"cited_paper":"/paper/2412.13871","citing_paper":"/paper/2505.24718"},"observation_digest":"sha256:634b21c264b0f8caaa0e8a456202f97695d6eb8a71d157d7126c416a9076edea","observation_id":"7bd86063-dc8f-43ee-b910-3d8236c3ae10","resolution":{"observed_at":"2026-08-07T12:22:12.643287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13871","snapshot_observed_at":"2026-08-07T00:48:34.447271Z","title":"Llava-uhd v2: an mllm integrating high-resolution feature pyramid via hierarchical window transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-16T13:31:16.270333Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:34.447271Z"},"links":{"cited_paper":"/paper/2412.13871","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:66b74c36977a80b30def3a8e564d2c0badba6362d24f28616084b802738a62bf","observation_id":"3d866024-da5b-4073-b695-8bf8b0b3a9ae","resolution":{"observed_at":"2026-08-07T00:48:34.447271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13871","snapshot_observed_at":"2026-08-07T04:57:50.575266Z","title":"Llava-uhd v2: an mllm integrating high-resolution feature pyramid via hierarchical window transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-15T14:31:42.163393Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.575266Z"},"links":{"cited_paper":"/paper/2412.13871","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:070bdd5a3f998dbf719a125344fc1bd73ed58a756c2cfe51d702b2b127b643d0","observation_id":"90a9cec5-14ed-48b0-9266-55363b3a1af6","resolution":{"observed_at":"2026-08-07T04:57:50.575266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13871","snapshot_observed_at":"2026-08-06T21:27:40.766319Z","title":"Llava-uhd v2: an mllm integrating high-resolution feature pyramid via hierarchical window transformer.arXiv preprint arXiv:2412.13871, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.766319Z"},"links":{"cited_paper":"/paper/2412.13871","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:5e53d3718aa3de05b36505d9d4d2393f6d5b1f1736098dbfac72ae26b891cf25","observation_id":"3f7e994b-b245-48c3-bdd9-998ef8bb5e91","resolution":{"observed_at":"2026-08-06T21:27:40.766319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"cited_work":{"arxiv_id":"2412.13871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13871","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-uhd v2: an mllm integrating high-resolution feature pyramid via hierarchical window transformer","venue":null,"work_id":"99f23a8d-c38f-4037-9d5f-a08d8e258fdc","year":2024},"citing_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-13T04:48:56.237545Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"reference_index":181,"source":"pdf_text","source_observed_at":"2026-05-10T11:58:58.660564Z"},"links":{"cited_paper":"/paper/2412.13871","citing_paper":"/paper/2508.18265"},"observation_digest":"sha256:976bd263c625e4c680fd3f034c1237bd111037e8de0d4a4dab654d6fc14b3e95","observation_id":"43792357-ef21-498d-85c7-8bdd247bec22","resolution":{"observed_at":"2026-05-10T11:58:58.975128Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"cited_work":{"arxiv_id":"2412.13871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13871","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-uhd v2: an mllm integrating high-resolution feature pyramid via hierarchical window transformer","venue":null,"work_id":"99f23a8d-c38f-4037-9d5f-a08d8e258fdc","year":2024},"citing_paper":{"arxiv_id":"2604.06912","last_updated":"2026-04-08T10:12:30Z","snapshot_observed_at":"2026-08-16T09:35:47.926898Z","submitted_at":"2026-04-08T10:12:30Z","title":"Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T18:46:26.869644Z"},"links":{"cited_paper":"/paper/2412.13871","citing_paper":"/paper/2604.06912"},"observation_digest":"sha256:08209b082b93eda74c1f60163670da7f97753cae3fd9e7bf9547c95934e93502","observation_id":"326c4e2a-52cf-4612-b9f8-7edb3c605d47","resolution":{"observed_at":"2026-05-10T23:55:52.954889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13871","snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Llava- uhd v2: an mllm integrating high-resolution se- mantic pyramid via hierarchical window trans- former, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-13T01:54:21.304319Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"cited_paper":"/paper/2412.13871","citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:a57cd037933ffd7ea4844b6a36ff11e082eeba204573c0ad20649d8585341a58","observation_id":"cdb03c63-ac96-41cd-b557-54e2890f3a6c","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.13871/citation-record","integrity":"/paper/2412.13871/integrity","json":"/paper/2412.13871/citation-record.json","paper":"/paper/2412.13871"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.336510Z","title":"https://huggingface.co/datasets/xai-org/RealworldQA","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.336510Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:d34a90eb8bd44ee5ec3b28647e2c8650c49f6acd65cc5ded9a69fce9b4bd96e4","observation_id":"5d938658-7d66-4962-baa3-f104b23cdbad","resolution":{"observed_at":"2026-08-11T12:46:59.336510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.342422Z","title":"https://openai.com/blog/chatgpt","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.342422Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:fb731811dca3c48e3a7dd8bf5ba856e34eb1ea3ebd534649beefe3301d76cff9","observation_id":"8726ff5f-9218-4400-89a3-342f28550a86","resolution":{"observed_at":"2026-08-11T12:46:59.342422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.347956Z","title":"https://huggingface.co/datasets/laion/gpt4v-dataset, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.347956Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:de1e27cebbeabe34c04b4cda6799f55ad8df8ec6e245b2e521ac13ec8673dddd","observation_id":"89178c1f-e3ba-487b-a310-eaf481564107","resolution":{"observed_at":"2026-08-11T12:46:59.347956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-16T19:40:28.523700Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T12:46:59.353376Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.353376Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:c96deaac5e8902c8f0f3cee9fc8cb57c0455a2b0331cd014334924b4e8163e2e","observation_id":"cebf44c4-247f-4149-a860-7f10a008f760","resolution":{"observed_at":"2026-08-11T12:46:59.353376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.01644","last_updated":"2018-11-22T23:40:00Z","snapshot_observed_at":"2026-08-09T22:50:03.459615Z","submitted_at":"2016-10-05T20:59:01Z","title":"Understanding intermediate layers using linear classifier probes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.01644","snapshot_observed_at":"2026-08-11T12:46:59.359870Z","title":"Understanding intermediate layers using linear classifier probes","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.359870Z"},"links":{"cited_paper":"/paper/1610.01644","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:f46e9aef0880cf95a35e81b6829a542a0cd93cda593916f3d534d19f1e2c7cf5","observation_id":"a20896bd-eb2c-4f37-b4a3-c15722d4b43e","resolution":{"observed_at":"2026-08-11T12:46:59.359870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.367120Z","title":"Menick, Sebastian Borgeaud, Andy Brock, Aida Nematzadeh, Sahand Sharifzadeh, Mikolaj Binkowski, Ricardo Barreira, Oriol Vinyals, Andrew Zisserman, and Karén Simonyan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.367120Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:48208170bc9099120d2ceeec1bcda7248607771bd44254bfeadfb8cf5d9bc29a","observation_id":"4f9bdd3b-9aa3-488c-91f3-2bd087fd22d3","resolution":{"observed_at":"2026-08-11T12:46:59.367120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.373279Z","title":"Multi-label cluster discrimi- nation for visual representation learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.373279Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:0064eb8a86322ddc04b6b3b76a5d1f0cd12b657908703902dbc2a1f128e3ae92","observation_id":"e26f5bef-9fa9-437d-baad-921084d76ef2","resolution":{"observed_at":"2026-08-11T12:46:59.373279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-11T12:46:59.378478Z","title":"Gemini: A family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.378478Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:c69d56a76885153c0a88e3c5e901ec47fab325e1b6ca9ce3e2abeca11f6ea45f","observation_id":"328a96cf-04c3-4bc5-9b45-c36c00a4d7d5","resolution":{"observed_at":"2026-08-11T12:46:59.378478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.385041Z","title":"VQA: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.385041Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:7dbbe4816f0f08ae813984480ce5880243b38775c71456eadd426a513e7f2ac2","observation_id":"12af006f-8cf2-4386-84e3-c77c47027708","resolution":{"observed_at":"2026-08-11T12:46:59.385041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.390439Z","title":"Vision transformer for fast and efficient scene text recognition, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.390439Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:a118bfe45ff7ead5e22bfc981c58132f79b4688089d9e018f5256aef4d0e04b0","observation_id":"440a624d-a99e-476b-838c-c8cbc026f9c8","resolution":{"observed_at":"2026-08-11T12:46:59.390439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T12:46:59.395415Z","title":"Qwen-VL: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.395415Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:b6a4dc5534f60c0c539b9a9e9039d617ec1d8aa93b911c7b313d8e82cb4f583b","observation_id":"a81f5960-63ae-4a89-808e-bfbd42309127","resolution":{"observed_at":"2026-08-11T12:46:59.395415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.401039Z","title":"Introducing our multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.401039Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:789e9cc7f2f80e7021b5ab2e597e59b10d6f04bb35ef53e8dcaa2a4eeef4e855","observation_id":"a03e2fd5-77dd-401e-82ef-045ff8e0ce75","resolution":{"observed_at":"2026-08-11T12:46:59.401039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-08-13T04:00:22.647615Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-11T12:46:59.405865Z","title":"Token merging: Your vit but faster","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.405865Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:1482e332e131ab76b911e5efdb521447cffae166353acc7c17341216c76382ca","observation_id":"2840d8cd-8db7-4540-9e21-53c2ad50dee7","resolution":{"observed_at":"2026-08-11T12:46:59.405865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.411828Z","title":"Burt and Edward H","venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.411828Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:bc4bdfa592b5504e71404ffa84fa77e7247ad91e081ff46923798088b5fa53b2","observation_id":"9beabfef-632d-4ce8-ab61-ace1893a7885","resolution":{"observed_at":"2026-08-11T12:46:59.411828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11829","last_updated":"2024-10-15T17:55:22Z","snapshot_observed_at":"2026-08-16T13:09:05.006894Z","submitted_at":"2024-10-15T17:55:22Z","title":"MMFuser: Multimodal Multi-Layer Feature Fuser for Fine-Grained Vision-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11829","snapshot_observed_at":"2026-08-11T12:46:59.417347Z","title":"Mmfuser: Multimodal multi-layer feature fuser for fine-grained vision-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.417347Z"},"links":{"cited_paper":"/paper/2410.11829","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:b9e4b62701c76caf81fff61177e5d6926bf96f4165d1428edf1c29d390e06098","observation_id":"9e1bfaab-7b61-43a5-b432-6ed8d8abb769","resolution":{"observed_at":"2026-08-11T12:46:59.417347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.422706Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.422706Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:32535895437e2d387ad86913aeb007e54c17e06a587c9768074303e62629abb5","observation_id":"b18ae7ab-6da3-4f44-b5c9-9058b371e453","resolution":{"observed_at":"2026-08-11T12:46:59.422706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-11T12:46:59.427857Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.427857Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:2204bf98ec2a9eb4594cecf6aecddd3dbf2e5dbba96283b21eaa35caf7696f60","observation_id":"40ecb40d-8b52-40eb-8f63-cca626689cc3","resolution":{"observed_at":"2026-08-11T12:46:59.427857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16866","last_updated":"2024-06-24T17:59:58Z","snapshot_observed_at":"2026-08-16T13:40:01.401453Z","submitted_at":"2024-06-24T17:59:58Z","title":"Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16866","snapshot_observed_at":"2026-08-11T12:46:59.433530Z","title":"Revisiting referring expression comprehension evaluation in the era of large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.433530Z"},"links":{"cited_paper":"/paper/2406.16866","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:181b05032eabd071134f74ae89e2311c73e47ef73d6390b04592fce6bcc3346e","observation_id":"0b2efd09-6a65-4065-bb2f-bb74d5075251","resolution":{"observed_at":"2026-08-11T12:46:59.433530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-14T06:42:43.375489Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-11T12:46:59.438565Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.438565Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:f4a8f86c35f4f3f4bd2a99659313e6ec0b4ef2c5819e50bc42adc3dafc7fa4dd","observation_id":"af2d6da7-065f-4bad-873b-d9af5e5e3b80","resolution":{"observed_at":"2026-08-11T12:46:59.438565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-11T12:46:59.443993Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.443993Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:64d50381cbf0d95c82e797f4cd50d6e18f3f1808cb9671bd8037dd4feeb3f745","observation_id":"40f7086e-4021-4ef2-9a6d-35cf011e9801","resolution":{"observed_at":"2026-08-11T12:46:59.443993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12889","last_updated":"2024-09-22T09:51:58Z","snapshot_observed_at":"2026-08-16T19:42:35.633409Z","submitted_at":"2024-09-19T16:30:25Z","title":"Can VLMs Play Action Role-Playing Games? Take Black Myth Wukong as a Study Case","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12889","snapshot_observed_at":"2026-08-11T12:46:59.449186Z","title":"Can vlms play action role-playing games? take black myth wukong as a study case","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.449186Z"},"links":{"cited_paper":"/paper/2409.12889","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:8ba848a5ad51333355a578b91df394e2c5208ae712fcb94e9c818ef66669fa99","observation_id":"6400ae54-8e11-4b0e-974a-666d9771c0b1","resolution":{"observed_at":"2026-08-11T12:46:59.449186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06438","last_updated":"2024-12-13T23:11:31Z","snapshot_observed_at":"2026-08-16T13:35:58.335260Z","submitted_at":"2024-07-08T22:40:15Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06438","snapshot_observed_at":"2026-08-11T12:46:59.454414Z","title":"A single transformer for scalable vision-language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.454414Z"},"links":{"cited_paper":"/paper/2407.06438","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:8231ec0ca6b459228de32a2755f33269c9bbf91e9c5865d8aed19db7f167019d","observation_id":"6d27094e-ac80-4478-9cc7-737b3866e3d9","resolution":{"observed_at":"2026-08-11T12:46:59.454414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.459532Z","title":"Vicuna: An open-source chatbot impressing GPT-4 with 90%* ChatGPT quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.459532Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:4d528ba257abb374b76668999b3849fc590ae7a163864df85f524d014f3cda39","observation_id":"73e02ea4-56cd-4aeb-be70-1336a6b14ac4","resolution":{"observed_at":"2026-08-11T12:46:59.459532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.464426Z","title":"Xtuner: A toolkit for efficiently fine-tuning llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.464426Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:9b084834c6262225bdd1872ca44b3b5dc7bbab07227433fdebd6e46e7074cc07","observation_id":"81438696-186d-4102-b4a0-5c48293d3d70","resolution":{"observed_at":"2026-08-11T12:46:59.464426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-11T12:46:59.469635Z","title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.469635Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:82a0f3924e6e7f4fb9aadccd6c77c7be7e0a74f6001576816fd50f081433ca76","observation_id":"33b02e12-757b-45f5-823f-fd29447ac61a","resolution":{"observed_at":"2026-08-11T12:46:59.469635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06512","last_updated":"2024-04-09T17:59:32Z","snapshot_observed_at":"2026-08-16T14:02:18.579046Z","submitted_at":"2024-04-09T17:59:32Z","title":"InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06512","snapshot_observed_at":"2026-08-11T12:46:59.475234Z","title":"Internlm-xcomposer2-4khd: A pioneering large vision-language model handling resolutions from 336 pixels to 4k HD","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.475234Z"},"links":{"cited_paper":"/paper/2404.06512","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:c5e3be049a198dc13fba5379b83adc3aa8b81982fcecdd356d38536b426fc04c","observation_id":"eb885f6b-a024-449c-a5b2-f291cf5bd7e3","resolution":{"observed_at":"2026-08-11T12:46:59.475234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.480439Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.480439Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:613a146b895763b6b2d98921249a523d4174aa8f1466d217d9698922b76baec7","observation_id":"f5e57181-18d6-410e-af4b-e35b9ffeb216","resolution":{"observed_at":"2026-08-11T12:46:59.480439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-11T12:46:59.485449Z","title":"MME: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.485449Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:1838a7ec2120391a093badff354b62c0d17fb1d22424b72de3b635c2804220f6","observation_id":"4b8e2d69-78ca-461b-93c9-914821742653","resolution":{"observed_at":"2026-08-11T12:46:59.485449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10516","last_updated":"2024-04-01T20:57:45Z","snapshot_observed_at":"2026-08-16T14:09:21.603187Z","submitted_at":"2024-03-15T17:57:06Z","title":"FeatUp: A Model-Agnostic Framework for Features at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10516","snapshot_observed_at":"2026-08-11T12:46:59.490711Z","title":"Featup: A model-agnostic framework for features at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.490711Z"},"links":{"cited_paper":"/paper/2403.10516","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:5f56c9065b6e548ccf4fb5ffe21698276ab95f4c38908504fe274e900b6fc211","observation_id":"b3c72ca9-ce90-4dfd-b677-93297f6c9d68","resolution":{"observed_at":"2026-08-11T12:46:59.490711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09844","last_updated":"2024-07-10T15:56:14Z","snapshot_observed_at":"2026-08-16T14:18:22.084265Z","submitted_at":"2024-02-15T10:01:55Z","title":"Jack of All Trades, Master of Some, a Multi-Purpose Transformer Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09844","snapshot_observed_at":"2026-08-11T12:46:59.495874Z","title":"Jack of all trades, master of some, a multi-purpose transformer agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.495874Z"},"links":{"cited_paper":"/paper/2402.09844","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:67b19afd9aa5ca917c145e4ffa5a66c39a91fe60e92a88d15fd37999b2f1764e","observation_id":"e369f5a0-d97b-49f2-b739-e8b58a348070","resolution":{"observed_at":"2026-08-11T12:46:59.495874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05935","last_updated":"2025-03-21T10:19:01Z","snapshot_observed_at":"2026-08-16T14:20:06.718576Z","submitted_at":"2024-02-08T18:59:48Z","title":"SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05935","snapshot_observed_at":"2026-08-11T12:46:59.501091Z","title":"Sphinx-x: Scaling data and parameters for a family of multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.501091Z"},"links":{"cited_paper":"/paper/2402.05935","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:96c8afe1decefd82a6eab6029ef2851790ff2d700652418378d0b17ad011f2ab","observation_id":"5f912bcb-b483-4bd9-8eef-d73b36f1e3da","resolution":{"observed_at":"2026-08-11T12:46:59.501091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.506302Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.506302Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:09d7df2c914804624c968adb184a224600374802e817f2f57746e62bc1be92ba","observation_id":"6000433c-cf29-4f0a-9898-d7fc1ee58c29","resolution":{"observed_at":"2026-08-11T12:46:59.506302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.512054Z","title":"Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.512054Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:819bec403d9d9fdddf5609b2fdfed0d649f814c3cae5e60bdc386499e7f6603a","observation_id":"d242c4f6-fc85-4337-ab09-75c0a09799d2","resolution":{"observed_at":"2026-08-11T12:46:59.512054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.517122Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.517122Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:6e745b6b4efc54f884145cd46b0cebfa4c2da0144d8855df5d8079306ba8a869","observation_id":"3bab988e-6a6a-4d8c-88ca-92e65352d052","resolution":{"observed_at":"2026-08-11T12:46:59.517122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.522099Z","title":"LLaV A-UHD: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.522099Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:f70fdbb7b19faf40cc95e0ecd53052381d45612701b7a7a538e27faeb26bc3be","observation_id":"a978c192-42c0-42ee-9b53-13584642a8fc","resolution":{"observed_at":"2026-08-11T12:46:59.522099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.527115Z","title":"VizWiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.527115Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:a7eb1adb32fa04d4a63d1e04e9fa797c9112bcf2444503f950c6457d56840938","observation_id":"464e57b3-2e21-4c87-a474-64c4a3faba6f","resolution":{"observed_at":"2026-08-11T12:46:59.527115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.06059","last_updated":"2020-10-02T14:39:37Z","snapshot_observed_at":"2026-07-06T09:37:32.530064Z","submitted_at":"2020-07-12T18:25:17Z","title":"It Is Likely That Your Loss Should be a Likelihood","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.06059","snapshot_observed_at":"2026-08-11T12:46:59.532147Z","title":"It is likely that your loss should be a likelihood","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.532147Z"},"links":{"cited_paper":"/paper/2007.06059","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:af4b4c4763b9884a3d810a44c57cb42f67eeb90243e0272ce6869d08c12a92e8","observation_id":"80a326f9-93c0-4c86-a0d9-db68247c9504","resolution":{"observed_at":"2026-08-11T12:46:59.532147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.538878Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.538878Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:95d1122d272efbab5fcc158d606877ad530eef1d403f86f6c7fdd6c26c603249","observation_id":"57fa13cd-02f6-4dcb-b617-ccf4beada08f","resolution":{"observed_at":"2026-08-11T12:46:59.538878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.544967Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.544967Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:7e5ac44b93b06b89ce860c64a2803b9d86c58cca1f997b12880386e38e4a89dc","observation_id":"4534fd55-d7ee-4fe3-ba40-675990ad0658","resolution":{"observed_at":"2026-08-11T12:46:59.544967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.549807Z","title":"Mask R-CNN","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.549807Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:3734b6f96206b92894edf168704a0b6c7dc4ecdff8fd23c038cf257862811e6b","observation_id":"d745fad4-e8ee-4ec4-bc30-0a3c9bfed479","resolution":{"observed_at":"2026-08-11T12:46:59.549807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-16T14:34:47.701708Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-11T12:46:59.555350Z","title":"CogAgent: A visual language model for gui agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.555350Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:b302dbc6dd6cb34ad7fda69f44fef5c7ff75e498cdfb76ce686077178817b4b4","observation_id":"6c829448-aa43-4727-aa99-45ef772a8d61","resolution":{"observed_at":"2026-08-11T12:46:59.555350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.561691Z","title":"GQA: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.561691Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:2e0740eb07787e67d1095e3cc713208eb6cbd78ce39f9a7fb33d9554cbc11644","observation_id":"3b99463a-c2f5-481b-9225-59fba3f95ded","resolution":{"observed_at":"2026-08-11T12:46:59.561691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.566778Z","title":"Synthetic data and artificial neural networks for natural scene text recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.566778Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:ed413bd1455c91e3a236d27f08192a3742115b500ba2a5c740a6032e6a7b9902","observation_id":"9610f394-12d8-4f88-8063-18e84da21ee6","resolution":{"observed_at":"2026-08-11T12:46:59.566778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.571912Z","title":"Chat-univi: Unified visual representation empowers large language models with image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.571912Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:5a27f3a35d331f7390b1cfcdd95ed1e0a0e96b17e283cf06b3278a14fdd993d4","observation_id":"53fefc95-47de-4e49-ad12-57cc8dfd8bbe","resolution":{"observed_at":"2026-08-11T12:46:59.571912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.577746Z","title":"DVQA: Understanding data visualizations via question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.577746Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:bdea673bfa69a9946d1205918f9ded9a3657d4d573327bbd1147e32616d2d0e8","observation_id":"44ab31ee-d5f2-4eb2-ac77-ed06829912ac","resolution":{"observed_at":"2026-08-11T12:46:59.577746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.583374Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.583374Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:88a18b05a27c33a91a230b4be4fccfc9b05f2e97f9235aa4bd9b37b5458be233","observation_id":"e61f89e6-39e6-49d9-ab70-abf183630820","resolution":{"observed_at":"2026-08-11T12:46:59.583374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1603.07396","last_updated":"2016-03-24T00:02:58Z","snapshot_observed_at":"2026-08-16T16:56:28.600506Z","submitted_at":"2016-03-24T00:02:58Z","title":"A Diagram Is Worth A Dozen Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.07396","snapshot_observed_at":"2026-08-11T12:46:59.589023Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.589023Z"},"links":{"cited_paper":"/paper/1603.07396","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:06cbd6c4c4fd72f67cd8ac15cc31557f9b6aa0cbec6d3dbe31e48a61e669d632","observation_id":"bf0c10f1-b32e-4690-9f68-1db2db626a10","resolution":{"observed_at":"2026-08-11T12:46:59.589023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.595507Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.595507Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:31d7e1674df4f8273fcfd2fd93f7983f638bdbf445c5cf32b0c3fcccb3c02423","observation_id":"59a84b43-14ec-446c-8aa3-1ed65a65ff0b","resolution":{"observed_at":"2026-08-11T12:46:59.595507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04836","last_updated":"2017-02-09T20:38:16Z","snapshot_observed_at":"2026-08-15T20:45:29.277746Z","submitted_at":"2016-09-15T20:03:06Z","title":"On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04836","snapshot_observed_at":"2026-08-11T12:46:59.601941Z","title":"On large-batch training for deep learning: Generalization gap and sharp minima","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.601941Z"},"links":{"cited_paper":"/paper/1609.04836","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:3cae8a3e51b4258f863b110c70bbcb43738b8cfc0be10a59055f58d5d561f2c3","observation_id":"844a8005-5df7-4d1f-a926-ccf5b365c54e","resolution":{"observed_at":"2026-08-11T12:46:59.601941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.608473Z","title":"Ocr-free document understanding transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.608473Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:9b95068119339ffcfdefd396de3a4a2621f683e5e38516958efe3fab06ff8457","observation_id":"0d4c8b8b-f4a1-41b8-9c54-51e05732990e","resolution":{"observed_at":"2026-08-11T12:46:59.608473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-11T12:46:59.614445Z","title":"Berg, Wan-Yen Lo, Piotr Dollár, and Ross B","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.614445Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:4c400e640c22ca4362fc01fb15f1f294e4da972d7442c628bcade0a4cb039d63","observation_id":"ccebcbdb-3519-4b9c-8dae-d85385937726","resolution":{"observed_at":"2026-08-11T12:46:59.614445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.620717Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.620717Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:411c1347d3ec607a8bf4fde1bb49b2cc113aa6e912c64e1e0e1475aa2b370c0f","observation_id":"a3300d09-90af-478b-a43a-7b6499cde8d3","resolution":{"observed_at":"2026-08-11T12:46:59.620717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.627051Z","title":"Pix2struct: Screenshot parsing as pretraining for visual language understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.627051Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:ecb03453bfc9a095e8dce09ab1a8ca971880f9acc4686317f03a2d442bf3b076","observation_id":"2c7adf03-c513-4f38-89c0-8eaf96a2b13f","resolution":{"observed_at":"2026-08-11T12:46:59.627051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-11T12:46:59.632684Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.632684Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:b34facd21002f49b29672dd755217cd4b05a9f77ab802e629934d1dd5ec99650","observation_id":"ebdcab75-016e-4367-8fde-6652120f67dd","resolution":{"observed_at":"2026-08-11T12:46:59.632684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04219","last_updated":"2023-11-07T18:59:58Z","snapshot_observed_at":"2026-08-16T14:45:10.647424Z","submitted_at":"2023-11-07T18:59:58Z","title":"OtterHD: A High-Resolution Multi-modality Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04219","snapshot_observed_at":"2026-08-11T12:46:59.639369Z","title":"OtterHD: A high- resolution multi-modality model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.639369Z"},"links":{"cited_paper":"/paper/2311.04219","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:09d82128991f6920b2fcc590d42210091fcbd2f178295855af2890e29c5fc7ab","observation_id":"95274e59-dab2-45e1-8daa-0e440bc6809e","resolution":{"observed_at":"2026-08-11T12:46:59.639369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.645252Z","title":"BLIP-2: Bootstrapping language-image pre- training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.645252Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:b08786bf86ea58728b767b2e33d954d050c4b049f3e46c453e73b0a2043eac29","observation_id":"2570af2f-4935-46e7-bcce-0fcfa510b934","resolution":{"observed_at":"2026-08-11T12:46:59.645252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-08-16T13:37:41.490963Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-11T12:46:59.651832Z","title":"Tokenpacker: Efficient visual projector for multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.651832Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:a40fcdc7938ffd18d75b044c5f20638c26eda6dff8243a232564ed3ee9241c4b","observation_id":"fb05bf86-a2c6-460a-8300-fb344eaa035b","resolution":{"observed_at":"2026-08-11T12:46:59.651832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-11T12:46:59.657618Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.657618Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:a5143105e7dcef2577675673409416f41d3f01572ee30b9378ef74224fd6b4a3","observation_id":"b3c1b57d-9700-4cc1-bf89-c0f4903b85ab","resolution":{"observed_at":"2026-08-11T12:46:59.657618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06607","last_updated":"2024-08-26T06:57:51Z","snapshot_observed_at":"2026-08-16T14:44:08.593739Z","submitted_at":"2023-11-11T16:37:41Z","title":"Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06607","snapshot_observed_at":"2026-08-11T12:46:59.662855Z","title":"Monkey: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.662855Z"},"links":{"cited_paper":"/paper/2311.06607","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:c78bcd8adf78793b9677260b836ad8216115dfe4d9797378ded6399c6b246108","observation_id":"f99a26e0-6a84-471e-9778-0f011d2d64ae","resolution":{"observed_at":"2026-08-11T12:46:59.662855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.668249Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.668249Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:7401b6d160c0a22be2c32ad4f85bc7cad03929cf3ade8fa2ff7279d399258782","observation_id":"fabb162a-e7d9-4bd3-a0f6-dc13ef9390b1","resolution":{"observed_at":"2026-08-11T12:46:59.668249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.679796Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.679796Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:5374724a85fd05ba7d19bb4e2aa4dc0a2ce6799c3800b3afff69ee0033ac0891","observation_id":"9a0cb0c4-3b8b-4c2e-ae79-f1ebbd2aa2f7","resolution":{"observed_at":"2026-08-11T12:46:59.679796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.685247Z","title":"Feature pyramid networks for object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.685247Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:3c9e4b006c47b207a96ae261754a43aa068ffee5489a9f3ff1dea862a512188b","observation_id":"f17a4449-0be6-4843-b37d-470c68708fc9","resolution":{"observed_at":"2026-08-11T12:46:59.685247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07575","last_updated":"2023-11-13T18:59:47Z","snapshot_observed_at":"2026-08-13T14:59:44.917623Z","submitted_at":"2023-11-13T18:59:47Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07575","snapshot_observed_at":"2026-08-11T12:46:59.690390Z","title":"SPHINX: the joint mixing of weights, tasks, and visual embeddings for multi-modal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.690390Z"},"links":{"cited_paper":"/paper/2311.07575","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:1f7af13f93b521601bee95c7dc47959c51eeea346e53260c2f13c3a57ce10444","observation_id":"a28a15d7-6341-41e9-9f43-9fd5a5a1b2c0","resolution":{"observed_at":"2026-08-11T12:46:59.690390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-15T23:41:03.981699Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-11T12:46:59.697300Z","title":"Aligning large multi-modal model with robust instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.697300Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:678d260f3b0f43e6212b7e4d6ae57d733b3cb823a4d634151c39c3adef9c4621","observation_id":"a07460a7-c114-436b-b1ff-0d8207bc7a00","resolution":{"observed_at":"2026-08-11T12:46:59.697300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.703540Z","title":"LLaV A-NeXT: Improved reasoning, ocr, and world knowledge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.703540Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:1723873eb14ff6d5944f1a181114ecf69488bf63e6424fb52091f37b63115fd4","observation_id":"4a415545-e2e1-4593-8ba9-e0cca7385aa9","resolution":{"observed_at":"2026-08-11T12:46:59.703540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-11T12:46:59.709359Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.709359Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:36f8d016cf334cdc95b85a9570e51b3faa8da05dac24bda5ada245749c179fa6","observation_id":"f6964874-820b-4799-b1a9-182c9f0838a8","resolution":{"observed_at":"2026-08-11T12:46:59.709359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.715679Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.715679Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:8eb9ee9b6504b918e84d19e36fec0a10fec4f6ff6ddc7dd92859ee1d9c2e1bb4","observation_id":"130ca913-574d-468a-9e4b-3dcc5753d830","resolution":{"observed_at":"2026-08-11T12:46:59.715679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-11T12:46:59.721647Z","title":"MMBench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.721647Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:a367ab3a65d7448c487b5458c1ef4887028dba6116b65a67d85b1496e8af61e0","observation_id":"adef2197-0dab-46d3-a36c-e5e5a1026e85","resolution":{"observed_at":"2026-08-11T12:46:59.721647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-08-13T22:21:37.032118Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-11T12:46:59.728554Z","title":"On the hidden mystery of ocr in large multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.728554Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:c3f212927ef073ea8923e385c8099a261f031b3e07aba81571e581d891363643","observation_id":"700232e4-a985-43e0-9b14-21cae2eeb0d8","resolution":{"observed_at":"2026-08-11T12:46:59.728554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-16T14:11:58.831714Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-08-11T12:46:59.735908Z","title":"Textmonkey: An ocr-free large multimodal model for understanding document","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.735908Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:873845d775348a840dd448f6e72652b363c614d547784929fc9a75ff5fdfc994","observation_id":"b9c8882b-a001-4348-bb7c-b9d814c12715","resolution":{"observed_at":"2026-08-11T12:46:59.735908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.741534Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.741534Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:52c96ac4e54180e7183248525aff35e5ccc7fd695355fcbcf2035d37b68b310c","observation_id":"570199d5-1f0c-4c73-b2e3-9974e24a9c9b","resolution":{"observed_at":"2026-08-11T12:46:59.741534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.746975Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.746975Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:cf7b76cd837e2403eae0309f9fa48beba1668de31e4be29c9034a874e2a9501b","observation_id":"d7927ca1-ff8f-4ae2-96ca-87fe29363896","resolution":{"observed_at":"2026-08-11T12:46:59.746975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-08-16T13:17:05.325564Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-11T12:46:59.752481Z","title":"Oryx mllm: On-demand spatial-temporal understanding at arbitrary resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.752481Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:7f01448a33d930b0951371fab9e41ba84d715391115b7adead6d36105582c6fd","observation_id":"b9d2e19d-f8bf-4f2d-b833-61b343c53b28","resolution":{"observed_at":"2026-08-11T12:46:59.752481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.758759Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.758759Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:114e850e916c36483a1adf4666ad79d8a730c4e3a5db696cc030a0452df88287","observation_id":"62e9c1e5-1b15-45ae-89aa-2c1521209817","resolution":{"observed_at":"2026-08-11T12:46:59.758759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-11T12:46:59.769436Z","title":"Deepseek-vl: towards real-world vision-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.769436Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:52495f92e3b48df741ec0056b536b4ea28194d582f29359983ae5c6dd7db3193","observation_id":"c8f54277-54f8-4a76-8275-0f4db1c07298","resolution":{"observed_at":"2026-08-11T12:46:59.769436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.774679Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.774679Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:c2ff5e77908b24a04d5c47b5903ba31e54914d16b2e90b5d577d32e022c2d55d","observation_id":"d81f0077-0e19-4813-a18b-2556d0eb8c78","resolution":{"observed_at":"2026-08-11T12:46:59.774679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-11T12:46:59.780850Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.780850Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:f859295fe04bfc8b2c8cae4227f07310c23a8573bbc2e228b5f61c50bd1c7e6c","observation_id":"a19b12ba-10c9-4aeb-b341-5ae3d70213c4","resolution":{"observed_at":"2026-08-11T12:46:59.780850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-16T14:12:38.033838Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-11T12:46:59.788297Z","title":"Feast your eyes: Mixture-of-resolution adaptation for multimodal large language models.arXiv preprint arXiv:2403.03003, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.788297Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:48ce394f1a30ca07b7451c2f1a5020c9070f3d6c9b099e232fce85ba234530cb","observation_id":"d1fbcd2d-5eeb-4534-b26f-702e31d809bf","resolution":{"observed_at":"2026-08-11T12:46:59.788297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:47:01.748910Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":"14ac582d-79ed-430a-8ba0-c71f66d5c27b","year":2016},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.797421Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:06f77c6762020db4da5873285a8b7145186caf914fa8ddd5cad7cfa47fd02f3b","observation_id":"3feb0f45-64a9-4928-aba1-01b0af72d850","resolution":{"observed_at":"2026-08-11T12:47:01.754295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:47:01.728594Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"845a9a5e-4f43-44ad-b20f-261e9fd1163d","year":2019},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.803942Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:99ab028fcfac0099a3ab9b507975500778ccd8ed65d49f78ca21d714ab073ec4","observation_id":"c183780f-367b-400a-8d60-eec880502efa","resolution":{"observed_at":"2026-08-11T12:47:01.734502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-11T12:46:59.815486Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.815486Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:bcc54f146211a9e2d8e9e51f7470e716796dbed02476b2db5e38782065c13522","observation_id":"205240e1-db18-4b72-8830-f1ed597a8fe8","resolution":{"observed_at":"2026-08-11T12:46:59.815486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:47:01.710611Z","title":null,"venue":null,"work_id":"2b8b2da6-d640-4b19-b984-7466f89f24fb","year":2021},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.820911Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:d59188e8ccb18e3c6c3fa6e4b11b5102fb44b7d75bc33ba9c4234ae08edc5a29","observation_id":"c73cdfa1-7b31-4b9f-9cdc-5b6cdeee9f75","resolution":{"observed_at":"2026-08-11T12:47:01.715883Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:47:01.689469Z","title":"Scene text recognition using higher order language priors","venue":null,"work_id":"ed39b3c3-6a6b-4a00-aede-b565ed8f94e8","year":2012},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.826429Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:e01f612c29913afd63ef193b9b40789003ba3aae18dfcdbe17611048a285846e","observation_id":"23cfa073-355a-4aaf-bacc-9af7ab0b407c","resolution":{"observed_at":"2026-08-11T12:47:01.696298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.833230Z","title":"Mishra, K","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.833230Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:302c51baa2f73f1cd6c5a148f39a5501436cf921137c6a64d7a3e21a9f6ececd","observation_id":"30e4065f-cd26-455c-8c27-ea349fe54298","resolution":{"observed_at":"2026-08-11T12:46:59.833230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.838784Z","title":"OCR-VQA: Visual question answering by reading text in images","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.838784Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:0fe581dd8bde4f65a0a3792978136668de9428c52f3020798d5a98d38ba598d0","observation_id":"dfff296f-3796-4572-b448-a7499d27f521","resolution":{"observed_at":"2026-08-11T12:46:59.838784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-11T12:46:59.844180Z","title":"DINOv2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.844180Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:cec9a7d3bf5239ca4d621517ade321adcfcfc0fdac1c7a7fc9372c233135ff13","observation_id":"af7366e7-23f5-42b2-9096-b4a98fa4865c","resolution":{"observed_at":"2026-08-11T12:46:59.844180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:47:01.643097Z","title":"Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models","venue":null,"work_id":"dbb3027a-4a9e-444f-810f-85fe521fbba3","year":2015},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.849557Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:43602ff423e1e2032179e29a908ab0069db4d9121a47a2b21882172b93a13425","observation_id":"6038b06d-71e0-4c7a-9447-ec297d7674db","resolution":{"observed_at":"2026-08-11T12:47:01.649784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.854568Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.854568Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:0e2f6d44adb298258263f6bdbd7833e56e9405262864fb3f02bb25884edafd7e","observation_id":"bbad4ce0-ba70-4b7f-ba12-df7744ec0fc0","resolution":{"observed_at":"2026-08-11T12:46:59.854568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.01497","last_updated":"2016-01-06T06:30:17Z","snapshot_observed_at":"2026-08-14T22:45:50.420062Z","submitted_at":"2015-06-04T07:58:34Z","title":"Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.01497","snapshot_observed_at":"2026-08-11T12:46:59.860098Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.860098Z"},"links":{"cited_paper":"/paper/1506.01497","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:1c3b93b04e855a2f0dca2f0942cac51944e92805d91d86abf54fcabdb1d4364d","observation_id":"87ce0e74-8d76-4f8b-8e4a-29170224c869","resolution":{"observed_at":"2026-08-11T12:46:59.860098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:47:01.613124Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":"77c53409-6e1f-4e15-81af-fd8d854df01d","year":2015},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.866480Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:0f50ffd143e48eaed6f71bc043214e28f7b57ddc67cec3471af9f003393259e5","observation_id":"7e5157a1-3b5b-4027-8f4e-6df2cf4d1be6","resolution":{"observed_at":"2026-08-11T12:47:01.619346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:47:01.590850Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge","venue":null,"work_id":"339378d8-db79-42e9-aa40-174d16311802","year":2022},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.872148Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:fcc3dfad7a372e38b0d736a5274f18c7d63b059cc110173efcda7661a9e75919","observation_id":"1ffbbb74-828d-4ef2-967e-98bc56d8650d","resolution":{"observed_at":"2026-08-11T12:47:01.596611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.880614Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.880614Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:e9e3970ae3673d1772d532ff8d86c4b21f188fd7d913fa688e1911b1753e89d1","observation_id":"c92c68b8-f2a8-488e-b768-ff2c6b798bd8","resolution":{"observed_at":"2026-08-11T12:46:59.880614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:47:01.572395Z","title":"https://sharegpt.com/, 2023","venue":null,"work_id":"eb2631db-9ff0-4433-be0e-a465ac2f49a7","year":2023},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.886130Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:be03dd23a6f80aab1d091f0a032523ec94e783d1812ddf975802fd23f116570a","observation_id":"bdecb3c0-182d-4649-bdcf-6d1ebd23bd73","resolution":{"observed_at":"2026-08-11T12:47:01.577922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15998","last_updated":"2025-03-02T23:41:37Z","snapshot_observed_at":"2026-08-16T13:23:07.170488Z","submitted_at":"2024-08-28T17:59:31Z","title":"Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15998","snapshot_observed_at":"2026-08-11T12:46:59.893904Z","title":"Eagle: Exploring the design space for multimodal llms with mixture of encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.893904Z"},"links":{"cited_paper":"/paper/2408.15998","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:87a2159471610235d7d247c37ac2f4baddb6c5cbd18bdd86d4e1db2aea9d35af","observation_id":"6ab493a7-7d1a-4b78-ac95-00766ae2826f","resolution":{"observed_at":"2026-08-11T12:46:59.893904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:46:59.902180Z","title":"Textcaps: a dataset for image captioning with reading comprehension","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.902180Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:8edd66df6fc08d5f69573a8e1e8ee2b17224ca08013fac1de5d1ebb991874e77","observation_id":"d416a56a-fc12-4a0c-a471-0d5edb227245","resolution":{"observed_at":"2026-08-11T12:46:59.902180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-14T23:20:42.336514Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-11T12:46:59.907264Z","title":"Very deep convolutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.907264Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:05e3b506d8afe2c7962531b121f2e637680dea8443791a5dbfe5a0ff29fbf780","observation_id":"4749b436-e51c-4900-9937-13a9854f3f11","resolution":{"observed_at":"2026-08-11T12:46:59.907264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:47:01.541931Z","title":"Towards VQA models that can read","venue":null,"work_id":"6a1ff271-ee99-4fc5-a381-9a6e2d66bafe","year":2019},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.913563Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:6be5de1b8f8c67f7818dac077cd73ad43dab69a2304b73633c9396b96a8c4ee3","observation_id":"77deabb1-6b4e-4b69-ba1f-1533f34d298a","resolution":{"observed_at":"2026-08-11T12:47:01.547774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:47:01.523794Z","title":"Document collection visual question answering","venue":null,"work_id":"407df989-c278-4885-82f3-4f1642f67392","year":2021},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.919338Z"},"links":{"citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:3e90aa9b1456ed959775fa090bd11368555c980b35975eff3b0104e7419177ca","observation_id":"8026eddf-f93d-42e7-8f6c-3b3eaa0da6f7","resolution":{"observed_at":"2026-08-11T12:47:01.530032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-08-15T07:01:36.213052Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-11T12:46:59.925267Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.925267Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:8c5122bd6abcf8e752287fcded668b588c901599b758adfb2a175e8b594b8991","observation_id":"81ff6200-b0b5-4bd7-bfe0-fb453f77266f","resolution":{"observed_at":"2026-08-11T12:46:59.925267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T12:46:59.931076Z","title":"LLaMA: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.931076Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:d5d225458346cb1344f64420073d5f15714edf0c35d4a0f4aec35e4957fd22d9","observation_id":"5f3aa4d2-32a4-4ba4-8d90-210d7364700f","resolution":{"observed_at":"2026-08-11T12:46:59.931076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":91,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":119},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 100 of 119 outbound references and 9 inbound Pith citation observations for arXiv:2412.13871."}