{"as_of":"2026-08-14T10:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0dbd250c079457666212a30933d4882976f856fd2170978fe31516e95ebc5978","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:19:45.204350Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.00505/citation-record","integrity":"/paper/2507.00505/integrity","json":"/paper/2507.00505/citation-record.json","paper":"/paper/2507.00505"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.623664Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"02cd56c0-dc2d-4a2c-83a8-491ff5214c92","year":2022},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:43.427456Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:39230d234c8c799dc119bc80b127f0e7437ea9b58001d3502491c125f54ebcfe","observation_id":"cee1f6ce-6a32-4bdf-9b3c-7352849c29ac","resolution":{"observed_at":"2026-08-06T21:19:46.629953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T21:19:43.475383Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:43.475383Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:8d757e9086ed9d36bab4b397d9932cd6e4b2810c99a6989ecece474c459daff5","observation_id":"ab0cc359-29f9-4889-99a6-c5525bbf7929","resolution":{"observed_at":"2026-08-06T21:19:43.475383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.605667Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":"24478def-7ef3-4c8b-90bc-79901db39e71","year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:43.517516Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:925976c123944bfda5a18f589beac7a6a93ba2995c7c4e230c015424b91962ad","observation_id":"6f2721f9-a9a1-483f-88cb-f0159f6ec301","resolution":{"observed_at":"2026-08-06T21:19:46.611398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.587424Z","title":"Conceptual 12m: Pushing web-scale image-text pre- training to recognize long-tail visual concepts","venue":null,"work_id":"94cfd9ff-e660-4a3f-8adc-c21eb9522676","year":2021},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:43.600087Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:f16b1aefe98f6bfdb6c136ba942ff82d5f0e59715e65335d22f1fc599d511704","observation_id":"b55466f2-e18b-4f99-a487-c8b24a190331","resolution":{"observed_at":"2026-08-06T21:19:46.593338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-06T21:19:43.631540Z","title":"Shikra: Unleashing multi- modal llm’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:43.631540Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:e8790f46a9042551b3379053f9e357a1bb374722673f617bd4c1c8db61bf87df","observation_id":"e98cef87-098b-4b09-9d65-a8faa89b346f","resolution":{"observed_at":"2026-08-06T21:19:43.631540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-14T06:42:43.375489Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-06T21:19:43.712897Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:43.712897Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:d66ede7e16b8ac244b73ece919b9075f39a3cb76240f8ac9ceeb7c858f75dff4","observation_id":"0c9fe8de-7a77-45bd-baba-7d4913a8f81b","resolution":{"observed_at":"2026-08-06T21:19:43.712897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06438","last_updated":"2024-12-13T23:11:31Z","snapshot_observed_at":"2026-08-12T23:26:17.661596Z","submitted_at":"2024-07-08T22:40:15Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06438","snapshot_observed_at":"2026-08-06T21:19:43.915177Z","title":"A sin- gle transformer for scalable vision-language modeling.arXiv preprint arXiv:2407.06438, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:43.915177Z"},"links":{"cited_paper":"/paper/2407.06438","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:6cd00b72773fc4312d0f313c49ce8ae56a10d7fd927b848bbfc7da3913649678","observation_id":"545f009c-c476-415b-8c41-ec954171c74e","resolution":{"observed_at":"2026-08-06T21:19:43.915177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.568528Z","title":"Uniter: Universal image-text representation learning","venue":null,"work_id":"15f8d431-4241-41b8-818a-a254a3127c98","year":2020},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.031994Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:05f5e59bd24a2a30834869e09ebf64b597523d2c28313345831de104b8c811a3","observation_id":"d1ada282-759c-40ec-8784-3aa7265ac3ae","resolution":{"observed_at":"2026-08-06T21:19:46.574843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T21:19:44.115572Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.115572Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:0d5d26c7b6ea53c102f5e3b2f51df6626501f86af8a987a4d40c929b30a55da1","observation_id":"e9145929-a1dc-4553-a4aa-6727d9e6cca7","resolution":{"observed_at":"2026-08-06T21:19:44.115572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.549908Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"a8538419-3466-4852-9863-c56ab20b0a16","year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.197563Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:4458f24dbdffd9784e322229ef9b87803650a7a4808cc4b4dfa2fd6787a55cda","observation_id":"6d7ef2a5-c6f2-4970-ae26-e0d07112cdc5","resolution":{"observed_at":"2026-08-06T21:19:46.555610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.531516Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":"8cadd899-b966-4ca5-8eb6-fda61e2c9425","year":2023},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.290139Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:f0b664f7d156521c179ec64dc3efffb52b1a210d59fb6aa9ef8330e3c072c3e3","observation_id":"6e9bb0d1-a4e3-412e-b890-99f880d9b9c6","resolution":{"observed_at":"2026-08-06T21:19:46.537078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.509345Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"489772a5-965b-4d47-9186-fc919d3c172f","year":2023},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.369599Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:76cab8a37e8d4bf772b5f99d2f929dcadcd29cbcbe6ab520fffc4817963c7480","observation_id":"3aa9277e-10de-47ab-b680-eb9f8412d345","resolution":{"observed_at":"2026-08-06T21:19:46.519939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-06T21:19:44.483409Z","title":"Unveiling encoder-free vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.483409Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:603abc6ebe0e874bbfc6f7bc473fc7e2b7369557b385dd7cc66a3ec543a2f1ef","observation_id":"e7305b86-daf9-40fe-b4aa-958b5de44d65","resolution":{"observed_at":"2026-08-06T21:19:44.483409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T21:19:44.585083Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.585083Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:123b8bdb9954d4de13f593f9673ba078a1cb91004d139d79af4bdd1e9ffa86ae","observation_id":"68489f04-2607-4e17-b14b-c4c59d5c6de7","resolution":{"observed_at":"2026-08-06T21:19:44.585083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-06T21:19:44.704161Z","title":"Mme: A comprehensive evaluation bench- mark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.704161Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:7add1125c0bb489c54ebfb019faab03618c195c2ddd7de175e19b3ba4d784bec","observation_id":"d73db33c-a918-4358-a229-4f0b58ebd1e4","resolution":{"observed_at":"2026-08-06T21:19:44.704161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.487300Z","title":"Mmgpt4lf: Leverag- ing an optimized pre-trained gpt-2 model with multi-modal cross-attention for load forecasting","venue":null,"work_id":"6a83cdd9-4745-488b-a874-1ff6b51db88f","year":2025},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.807213Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:b3ca2fc52ebba768711b270af02690eab0c64914a3f59e3c175185029de94554","observation_id":"e67fd48f-ed16-4bfd-b86f-e8dd213de02e","resolution":{"observed_at":"2026-08-06T21:19:46.493689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.470757Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"c85abe08-9fdc-4506-a3ff-d5369062b25e","year":2017},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.881633Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:2d8f56bcad25a322f0c9435a7c2609baedd50eabfc0c86315cefd8c0567632b8","observation_id":"e03fe239-a1a0-40f4-8940-fbe98b498ecd","resolution":{"observed_at":"2026-08-06T21:19:46.476285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.451537Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":"bc168b0e-a5e7-4da1-b8ef-ebe9769c2208","year":2018},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.896147Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:9350b82ca8b5875ef99b129833c282108ed66f52508fdb36f8f54e2f78ac8564","observation_id":"2e250998-a5bd-4a2b-846f-6d6d09f20097","resolution":{"observed_at":"2026-08-06T21:19:46.457966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-13T04:16:46.302787Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-06T21:19:44.920866Z","title":"Efficient multi- modal learning from data-centric perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.920866Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:81f11850ab73c105c980cce8de9eed8129354bbd93db6c7166dd6d5b6de7bbb8","observation_id":"97b4e0f1-3f29-4140-b356-8d4085e4f5d3","resolution":{"observed_at":"2026-08-06T21:19:44.920866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T21:19:44.926088Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.926088Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:47b00c695bd2954c1c8988a80f2f650d3f6cb9f8d39c8de7bc38dc98e5056a1a","observation_id":"39b07aac-03de-48a1-9614-df0622cafa0d","resolution":{"observed_at":"2026-08-06T21:19:44.926088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:44.931122Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.931122Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:66db24be17196dac6792ff27bc31c4518dd68814e3932209aeb964e06e8aaa03","observation_id":"37f40682-d614-42b4-a53a-4d2462c1cde0","resolution":{"observed_at":"2026-08-06T21:19:44.931122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-08-13T00:16:01.500475Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-06T21:19:44.936712Z","title":"Mantis: Interleaved multi-image instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.936712Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:4322dd0e806bcb3551626adf587c35cb7f14808b7044572d49ea1262c29a0396","observation_id":"a125aabf-069c-468e-893a-6409cbfc2219","resolution":{"observed_at":"2026-08-06T21:19:44.936712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.422637Z","title":"Dvqa: Understanding data visualizations via ques- tion answering","venue":null,"work_id":"9a04a434-eb35-42a7-9339-9982f7aea628","year":2018},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.941653Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:3969dedc224c32c0fdb84ab1acb66365e2699e6fa5c5711751aa4db822f4f3d9","observation_id":"4c4ce55f-2ae4-497d-8c5c-be6f910a51c7","resolution":{"observed_at":"2026-08-06T21:19:46.427769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-06T21:19:44.946588Z","title":"Seed-bench: Benchmarking mul- timodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.946588Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:8dc22cb595d249d937c831bae75fdc6761414dff4da63268e969d208e37f7654","observation_id":"7e2dc6ef-960f-4711-9de2-38504f54325f","resolution":{"observed_at":"2026-08-06T21:19:44.946588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04219","last_updated":"2023-11-07T18:59:58Z","snapshot_observed_at":"2026-08-13T05:30:21.682589Z","submitted_at":"2023-11-07T18:59:58Z","title":"OtterHD: A High-Resolution Multi-modality Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04219","snapshot_observed_at":"2026-08-06T21:19:44.950880Z","title":"Otterhd: A high-resolution multi- modality model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.950880Z"},"links":{"cited_paper":"/paper/2311.04219","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:50b9639b22c8e58dc29eb291940a2f21447e78c975b72cce85fc87feb5a8e5bb","observation_id":"1a7db1ba-c02c-4de9-9908-3c8a97f2f384","resolution":{"observed_at":"2026-08-06T21:19:44.950880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.405889Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"584bb31f-23f7-44d3-92f4-66749d22d409","year":2022},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.956249Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:c14c85793d4bc92ebe4094726ae9136c067ed1a9032eb1c01c2385ac940b1768","observation_id":"ee97ffc7-ea7d-484f-9daf-344ab183e9ce","resolution":{"observed_at":"2026-08-06T21:19:46.411783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.389658Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"5b99984a-a4f0-4376-a039-e4c2a7cdede8","year":2023},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.961149Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:f602e31330a11c5a3526c67dc32ae0f3428ccfdded9f943ef30ff210020d049d","observation_id":"fec20d40-0c96-4c3c-8727-edda88af5379","resolution":{"observed_at":"2026-08-06T21:19:46.395048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-06T21:19:44.965646Z","title":"Evaluating object hallucina- tion in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.965646Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:7edfe06272378f86f127e013956754b7df4bdca9788c674ea4aeeb53067b44c6","observation_id":"adbb46d0-1439-4dc9-ac89-57bb7b0e8210","resolution":{"observed_at":"2026-08-06T21:19:44.965646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-06T21:19:44.970173Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.970173Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:033cea045a719a6accf7ed663b869443f65cb35e9e388f828c9e24a39d00e986","observation_id":"92d33b10-36b3-44dc-8822-a3e46aab0ad4","resolution":{"observed_at":"2026-08-06T21:19:44.970173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.370511Z","title":"Mon- key: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"c0c3e0e2-090f-49c6-9a62-e68b0c1c247c","year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.975214Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:b068bda7f7a1c97509ca5b292b9f647445e11727a0eae8a3926b9a8c955fea11","observation_id":"a0e70f54-e15c-4080-9aa0-952c91d5f73a","resolution":{"observed_at":"2026-08-06T21:19:46.376466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.353637Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"58600947-d0e1-4451-8c62-c2176d304acf","year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.979454Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:cd9f7b27c05fbe007d9e76d2f8417d3cc34e54c66bc796fa20d3208ca852523e","observation_id":"359df87f-915d-4925-aed3-013de3b65b0c","resolution":{"observed_at":"2026-08-06T21:19:46.359343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07575","last_updated":"2023-11-13T18:59:47Z","snapshot_observed_at":"2026-08-13T14:59:44.917623Z","submitted_at":"2023-11-13T18:59:47Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07575","snapshot_observed_at":"2026-08-06T21:19:44.983616Z","title":"Sphinx: The joint mixing of weights, tasks, and visual embeddings for multi-modal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.983616Z"},"links":{"cited_paper":"/paper/2311.07575","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:01bb39b459f1f8a4dbd412dcba263e337cfa79e796b87290ab29a1138fdfa924","observation_id":"5c43d5bd-080b-44d8-a57f-8defc6663b94","resolution":{"observed_at":"2026-08-06T21:19:44.983616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-13T06:40:28.574929Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-06T21:19:44.987878Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.987878Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:c4848c45578709dbfa3c3b764fcb21250aae8674c9def34aaaef211b4fee5b73","observation_id":"9665645e-4cba-4403-8551-2dfccc20952f","resolution":{"observed_at":"2026-08-06T21:19:44.987878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:44.992726Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.992726Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:77deccfd7af5e4c7e39f18766663af8bd9f264aa5eecacf8cb6600d63a159fcf","observation_id":"77762b0e-6226-4098-ab4a-7f3de606e4fb","resolution":{"observed_at":"2026-08-06T21:19:44.992726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:44.997621Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.997621Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:66be146ab1683e74950e1a5b505ccafb0cf4f64e6c34fc70aea38d08a909fb57","observation_id":"54ee26ed-be62-4a20-8a4c-3d777a7ae95f","resolution":{"observed_at":"2026-08-06T21:19:44.997621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.315297Z","title":"Mmbench: Is your multi-modal model an all-around player? In ECCV, pages 216–233","venue":null,"work_id":"6308c4dd-3532-40ca-9faa-cdc526760ccd","year":2025},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.002680Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:efd06d4fa4d2de71861c93e17fe2d262dcf200157220169ce42239c7f99ff01c","observation_id":"68c43b42-5a1a-49f0-bf9d-63210c86902f","resolution":{"observed_at":"2026-08-06T21:19:46.321340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.298236Z","title":"A convnet for the 2020s","venue":null,"work_id":"b4c8e6e7-e8a8-423e-b317-e8d70dbc1b6e","year":2022},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.008240Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:a8e0feb5eebc56f8f8bd73790d45bf8df0637f45ab5e0a488940e96f213d35f3","observation_id":"2edb4b9e-99df-45ef-adb5-42ba2f571515","resolution":{"observed_at":"2026-08-06T21:19:46.303530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.278201Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"64d57c08-f1c2-43fa-8c61-dcc9d2198308","year":2022},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.013156Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:0f6f085c9cb12bb58b49ad69ac1cb49ce139f491c7464dec0c5f4cdd4da9772c","observation_id":"d0ef25ee-4b4b-4d37-aa7c-ec6ec9e42007","resolution":{"observed_at":"2026-08-06T21:19:46.287850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-13T04:03:01.615934Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-06T21:19:45.018551Z","title":"Feast your eyes: Mixture-of-resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.018551Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:bf4f1ef3b5f5ef91aba7e7895b98f5716a3aa5ee06d3aedc2c225d26cdc4c57f","observation_id":"0870f533-a5ce-4bec-b390-43a3a9d4e9ab","resolution":{"observed_at":"2026-08-06T21:19:45.018551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:45.024693Z","title":"Unirgb-ir: A unified frame- work for rgb-infrared semantic tasks via adapter tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.024693Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:ed7e5ec6be27513d2ea03e687eed4a82e5bec5a2136f7d263ec8cc67a214c0b0","observation_id":"2f1baa1c-0008-485a-91cf-4a9730393dd8","resolution":{"observed_at":"2026-08-06T21:19:45.024693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:45.029990Z","title":"Gpt-4v(ision) system card, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.029990Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:c681de1fc5f66182912257420ab23922b17ff05d02c36e19d1980eb1746280de","observation_id":"4c90dc6b-1bd6-49ab-b71e-951cbf27c62f","resolution":{"observed_at":"2026-08-06T21:19:45.029990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:45.035094Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.035094Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:6a957d9186eaaae14a43652f9b9a3f396d846b86c64215c5eeded8bf0f34b5e2","observation_id":"10f53c0c-c4a9-4b9e-8b31-45b6b3d077d9","resolution":{"observed_at":"2026-08-06T21:19:45.035094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.240211Z","title":"Im2text: Describing images using 1 million captioned pho- tographs","venue":null,"work_id":"b35956ae-f921-4361-b1dd-be497d89f616","year":2011},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.040957Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:5512776eaf93013963c5cb6677669b2ce192792c24cbb44b609ff3684632fd56","observation_id":"61817f82-debb-4b6f-9f30-5a9c7a65cf73","resolution":{"observed_at":"2026-08-06T21:19:46.245228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.224807Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"af5725dd-9e31-4322-8dcf-63406b9a1e54","year":2021},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.045946Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:a13e59d5166abf56c56c3a5b9c2139550a874124210e4d0cb2d437c11df69c38","observation_id":"86824750-a82c-400a-90c0-6109603038fc","resolution":{"observed_at":"2026-08-06T21:19:46.229834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.208305Z","title":"Introducing our multimodal models, 2023","venue":null,"work_id":"1b6a0b69-bd3c-45d7-a6ea-ceb36aaa0ee2","year":2023},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.051203Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:9528ab0a34bce4612bf300ea4f3a77977de9fcccb3dae7ce602ff74aeb8aa886","observation_id":"42a8aa21-46f4-4598-a6f7-94c37158d116","resolution":{"observed_at":"2026-08-06T21:19:46.213938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-06T21:19:45.056171Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.056171Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:594fd9e0ddc4fe5647f611cd5845ae121f7af084e7ad3a37f7b1117d17ba6394","observation_id":"b1a630e2-8570-472b-a26a-bea2785aed4c","resolution":{"observed_at":"2026-08-06T21:19:45.056171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15998","last_updated":"2025-03-02T23:41:37Z","snapshot_observed_at":"2026-08-12T22:55:41.155703Z","submitted_at":"2024-08-28T17:59:31Z","title":"Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15998","snapshot_observed_at":"2026-08-06T21:19:45.062070Z","title":"Eagle: Exploring the design space for multimodal llms with mixture of encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.062070Z"},"links":{"cited_paper":"/paper/2408.15998","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:a942bfb6c010ced37496beb9b07651b6d01090bed6a2fac1b835cbd420f17c89","observation_id":"0a7bcfc6-44a7-4e98-ac0f-e6e35e9920ad","resolution":{"observed_at":"2026-08-06T21:19:45.062070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.190354Z","title":"Towards vqa models that can read","venue":null,"work_id":"20b1e642-62b7-4b12-b03c-7396b2b28421","year":2019},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.067048Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:4801f6b0d42951ae5c553886a80396cc16bbb99f35ef8fb091a9392b2b7841a3","observation_id":"301a441b-d411-4a07-a674-d5140293ea0d","resolution":{"observed_at":"2026-08-06T21:19:46.196495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.172459Z","title":"Towards vqa models that can read","venue":null,"work_id":"e623691d-b8b4-4c7d-ab57-0815e9259313","year":2019},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.073006Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:9841f8ae845b7553a4eb0ee94f41d40d740d16f3fb714810a71dfbe421230c64","observation_id":"77389585-b3f9-4a47-ab97-aa12d7948fa4","resolution":{"observed_at":"2026-08-06T21:19:46.178948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:45.079975Z","title":"Adapool: Expo- nential adaptive pooling for information-retaining downsam- pling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.079975Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:066d40bd9e8b7adf7f92b95fde4217ac64752e689b25d67493b7b11410737de6","observation_id":"3b8bd4df-b998-43a8-a499-7dc662571fe8","resolution":{"observed_at":"2026-08-06T21:19:45.079975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T21:19:45.086031Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.086031Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:70a67de65cd313b343bf5a1d4af636807a626bab61622b0df96b087c66abc8ad","observation_id":"bbc6f390-ff3c-4a79-84d7-ea45e7c07116","resolution":{"observed_at":"2026-08-06T21:19:45.086031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-08-13T06:27:06.478433Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T21:19:45.091175Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.091175Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:69c834c1c99eb24e64277953e53e1f6e87df5d473a89cca3bd60ac98196c7e04","observation_id":"72462e34-fbb2-48d0-9d92-2f6d9989153a","resolution":{"observed_at":"2026-08-06T21:19:45.091175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.143014Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"2d4733c0-529c-43aa-8665-884721b3b3fb","year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.097816Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:5b0e091149ae11cd2ffe58e05e18d4b2c05e2652f94cc5c6afcabe87087bc1f5","observation_id":"44557196-22e8-4c08-8f0d-2e3ff4fb4a5b","resolution":{"observed_at":"2026-08-06T21:19:46.149443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T21:19:45.104103Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.104103Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:b94f927ef094e32b2e612ce69dc0ed77d46a2fece05a616a78a9469e89b557cd","observation_id":"38bd5eed-883d-4378-aabc-c748c6c41fcc","resolution":{"observed_at":"2026-08-06T21:19:45.104103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.125703Z","title":"Vit-comer: Vision transformer with convolu- tional multi-scale feature interaction for dense predictions","venue":null,"work_id":"967b64e2-035b-4144-9b90-ccf2dfb29475","year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.109266Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:8afac4052d1a72963df0b3a24799947dbd425a227c670dfa911572b35f633095","observation_id":"d99a8b76-1fc4-4252-8b4a-f455e17a2046","resolution":{"observed_at":"2026-08-06T21:19:46.132019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-13T00:51:59.402203Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-06T21:19:45.114851Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.114851Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:2b94c517e2c0323e7c0c83f1e3494d16343558ba37eacd208c25b1c74deded71","observation_id":"04f360b7-f5ba-4a69-b6cf-8a1077010caa","resolution":{"observed_at":"2026-08-06T21:19:45.114851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:45.121380Z","title":"xgen-mm (blip-3): A family of open large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.121380Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:b79afa3b0ca9c586a5140c300ba97f1d152e5b072ad5b79e59398cafcf0027da","observation_id":"fca24d84-cd1c-417a-bb59-ff56e4f0d028","resolution":{"observed_at":"2026-08-06T21:19:45.121380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13800","last_updated":"2024-11-14T23:53:05Z","snapshot_observed_at":"2026-08-13T00:02:01.586554Z","submitted_at":"2024-05-22T16:25:03Z","title":"Dense Connector for MLLMs","version":2},"cited_work":{"arxiv_id":"2405.13800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.13800","snapshot_observed_at":"2026-08-06T21:19:45.422492Z","title":"Dense Connector for MLLMs","venue":"cs.CV","work_id":"57428f60-acd0-4a48-b6d2-3db5ba474bec","year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.127437Z"},"links":{"cited_paper":"/paper/2405.13800","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:89ccc1bff5c72ab16ec372c82905fd06d63d7f472d82e3f829daafade83e9cf2","observation_id":"b53642ed-20c3-4215-833c-5837dc8c421f","resolution":{"observed_at":"2026-08-06T21:19:45.429257Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.109278Z","title":"Image difference cap- tioning with pre-training and contrastive learning","venue":null,"work_id":"d2b3be12-86d8-4a06-a762-7964e62d11f9","year":2022},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.133736Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:364950a8141c6eacf642e9f78f871de33584aa49cc199b76fbe5e6a6a3276b56","observation_id":"5be07de4-f1f7-4d71-8631-80c31b637cec","resolution":{"observed_at":"2026-08-06T21:19:46.115108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-12T23:53:00.854564Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-06T21:19:45.139225Z","title":"Deco: Decoupling token compres- sion from semantic abstraction in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.139225Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:da50424612117a07a50eb20ec3fbf562f98ebd57caad1aacc11fc56d3ecd217c","observation_id":"34b26c7e-af54-4113-a51c-b0978ddb19d5","resolution":{"observed_at":"2026-08-06T21:19:45.139225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.091533Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":"a8b903c7-001e-45a3-aada-bd83c82de1a5","year":2016},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.145435Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:7115f248fed39853cef6681631ae5ee2cf9bb002c3a1d07370de572d2afe60b6","observation_id":"6b84d7fd-9ebe-4e04-ad98-20fcbb1b05a8","resolution":{"observed_at":"2026-08-06T21:19:46.097275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-06T21:19:45.150548Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.150548Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:0bbd411752f9bf48441aeeb55f7b0832f0f09b49a3c5134b65e94267d0d5f991","observation_id":"4591d180-2c6b-4798-99d0-f88e1091ee2a","resolution":{"observed_at":"2026-08-06T21:19:45.150548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.074169Z","title":"Improving rgb-infrared object detection with cascade alignment-guided transformer","venue":null,"work_id":"6d68bb51-2dcf-4edc-b0c3-e2f16d67f7f6","year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.155968Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:a1301d21b50f821e7d00d4ae26ad9f0c27ecc82cf0fb91c407ec4e0f3cb260b2","observation_id":"8041b73d-0350-4191-a166-d342e42d7523","resolution":{"observed_at":"2026-08-06T21:19:46.079474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.056071Z","title":"Lane detection transformer based on multi- frame horizontal and vertical attention and visual trans- former module","venue":null,"work_id":"a4b4e70d-85c0-4c9b-b9c0-a9fc8ac22d57","year":2022},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.161184Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:5dee4de18c5b7140bafdb240b014915187e3a9d04fd1e39498709f9a33f02805","observation_id":"cd0d889e-0e3b-40f4-bc79-bbe21341c7ae","resolution":{"observed_at":"2026-08-06T21:19:46.062261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-08-14T05:35:40.487992Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-08-06T21:19:45.166758Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.166758Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:65bbdb3498760491a2a590b6bcadfc769c2d7fcb1b9ed77e9e58393f302e4f25","observation_id":"b7cadc4d-47b2-4570-921e-e97df1d5db9c","resolution":{"observed_at":"2026-08-06T21:19:45.166758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:45.173798Z","title":"Removal and selection: Improving rgb- infrared object detection via coarse-to-fine fusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.173798Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:dee27ee1cd8287e1633ced85e914f4db5d6c223e521d2f32471b3bc328b548d7","observation_id":"22f5ab8f-4ecb-46d3-b237-dc67a5255b2c","resolution":{"observed_at":"2026-08-06T21:19:45.173798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T21:19:45.179796Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.179796Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:1c0459bc28a5954649b36d9e914a7139a406f1981b773faf42be6eca20ffcaa3","observation_id":"b728e6cb-ce85-4178-9119-4c47f55440c3","resolution":{"observed_at":"2026-08-06T21:19:45.179796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-08-13T17:54:01.724774Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-06T21:19:45.185864Z","title":"Deformable detr: Deformable trans- formers for end-to-end object detection","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.185864Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:808a1724f2d79e04083ce4cfdd59bda5b2d7bcc7f2f65b80f43e3ffba48c3205","observation_id":"504e8ba0-fff7-4e4e-b664-abed4832f663","resolution":{"observed_at":"2026-08-06T21:19:45.185864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.022104Z","title":"Future work will involve experiments on various LLMs such as Qwen2.5, Mistral, and LLaMA3","venue":null,"work_id":"950df5c3-5572-4d90-b37f-9ccfd0e8fab3","year":null},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.198962Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:8a1bed7e7e1bb48894d9941ff1c2e9b22c6fde65d4bbe5c7750a0687722adda0","observation_id":"4fa3c775-5141-4b1b-a531-3693d22ca1c3","resolution":{"observed_at":"2026-08-06T21:19:46.027455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.003658Z","title":"The input and output channels of the convolutional kernels are 1024 (equal to the visual feature dimension output by ViT) and 512, respectively","venue":null,"work_id":"1ba3c956-dcc9-4752-a276-5c311d91a0de","year":null},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.204350Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:766b2a882d6ea0e8212f72cb335889adca58085e7888a19133bf6196688b6392","observation_id":"a08b0375-8b33-4c30-a8b9-e9dcc87f04fc","resolution":{"observed_at":"2026-08-06T21:19:46.010281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:46.039638Z","title":"CLIP-bind pairs","venue":null,"work_id":"c2c631cf-cfe6-4c92-8499-9a1d518fcab3","year":null},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":512,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.192425Z"},"links":{"citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:552dfe3db3bd961ece4a7370511bc0660bada60196f1a3aeafda1ffd98ec13be","observation_id":"04e26855-5c68-4bb6-8c77-55131c8235a2","resolution":{"observed_at":"2026-08-06T21:19:46.044601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":1,"verified_fuzzy":32},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 0 inbound Pith citation observations for arXiv:2507.00505."}