{"as_of":"2026-08-18T09:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e6a2236b2f27f8b7cf5c926d5bad12eaa7213aef2c2c81253a081974555cc18c","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T16:45:44.870849Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.09817/citation-record","integrity":"/paper/2412.09817/integrity","json":"/paper/2412.09817/citation-record.json","paper":"/paper/2412.09817"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.659646Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.659646Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:07cf97817416f4d17c10a843e6613c446230534f71681f50a198fc40b3c4b796","observation_id":"ab2c5cd8-8afd-46f6-aff5-a1120b759a2c","resolution":{"observed_at":"2026-08-11T16:45:44.659646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.664145Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.664145Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:4fac0194307764d9a1174b3ed4cc3a157c2bfe05ebd90157b817a417f02318e0","observation_id":"26459d2f-3047-470f-9171-71096ab547f7","resolution":{"observed_at":"2026-08-11T16:45:44.664145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.493243Z","title":null,"venue":null,"work_id":"e5be39c1-8fe0-4cca-b206-a9fed544f528","year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.668737Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:a31a506ad26481ecaf068f97dbff158191e755c462f4ffb61ce238927079d0ac","observation_id":"aaf457e3-f2df-4deb-8169-82c9c15c62a4","resolution":{"observed_at":"2026-08-11T16:45:45.497001Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-11T16:45:44.672692Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.672692Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:825255bf9191536b5b54335d2c0fa3acd49faffe3d01f130f9e745c943d73162","observation_id":"de3f5a70-9bd8-4bca-bd00-eb1f083de74b","resolution":{"observed_at":"2026-08-11T16:45:44.672692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-16T14:10:58.157918Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-11T16:45:44.677283Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.677283Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:2af982d0775fa4b1101ed177ed8dba32b4f7ecba0eb6dc9e610d37fcabd703b1","observation_id":"c065c839-cc18-4729-a2f2-bd9c412471da","resolution":{"observed_at":"2026-08-11T16:45:44.677283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.482669Z","title":null,"venue":null,"work_id":"c24085e8-7038-4b99-8375-a5a02bc1f4fb","year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.681789Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:2b35c5ab67c762143fa1223e5665feb37ca4c3529eb1ed3b3017dc1eb3d68998","observation_id":"8deb9786-40bc-4052-b46b-5b4eeeda68e0","resolution":{"observed_at":"2026-08-11T16:45:45.486002Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-11T16:45:44.689734Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.689734Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:7f13c5cd89bc6778e21ccb6c5c5af5f8cc542a44468ffb147fdd25495b0869ad","observation_id":"dc2b24e6-c43d-4ecb-b453-762a7e6c9de8","resolution":{"observed_at":"2026-08-11T16:45:44.689734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-11T16:45:44.693657Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.693657Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:d3d6fa82388ee11fde4eda03c470f3f959e8091186c8bbed4764af4e98b4841b","observation_id":"6b751465-a209-4e61-9e02-4ab9df02e2e7","resolution":{"observed_at":"2026-08-11T16:45:44.693657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.697445Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.697445Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:5daa4aad77937c66ab63fc2aac0b96b087d50180ebb4064548dcda59f5ac4e0c","observation_id":"18c75d0a-b2f2-4773-a2f8-8fc7c8dd3284","resolution":{"observed_at":"2026-08-11T16:45:44.697445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.701291Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.701291Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:4ab7168ef46c0d2c978de2c67998e72aa3a93094d4aab1169118941aedf54ad1","observation_id":"3c3a9258-cdbb-4d5b-92a2-039e3c1d37d9","resolution":{"observed_at":"2026-08-11T16:45:44.701291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.456437Z","title":"K.-p.; Qian, T.; and Wang, S","venue":null,"work_id":"61996803-9581-44ac-88a1-33aa63543c01","year":2025},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.704823Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:4bc17c61b49abc821c511fdfb2acad50a354b00fb3035867b11f11f5563bb65b","observation_id":"4adf3b1b-e2f3-4a84-8a27-eb4d1093642b","resolution":{"observed_at":"2026-08-11T16:45:45.462402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.05612","last_updated":"2018-07-29T19:11:57Z","snapshot_observed_at":"2026-08-14T20:46:56.185352Z","submitted_at":"2017-07-18T13:51:32Z","title":"VSE++: Improving Visual-Semantic Embeddings with Hard Negatives","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.05612","snapshot_observed_at":"2026-08-11T16:45:44.708251Z","title":"J.; Kiros, J","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.708251Z"},"links":{"cited_paper":"/paper/1707.05612","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:476c72a5779ce73bb9feb18b024a1e4260f9e58895f18d44b3986db835274406","observation_id":"57a9ad2d-a67b-4079-a171-e7daf591b99f","resolution":{"observed_at":"2026-08-11T16:45:44.708251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.711987Z","title":"S.; Shlens, J.; Bengio, S.; Dean, J.; Ranzato, M.; and Mikolov, T","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.711987Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:381bba7695998f74857bc4bac1ce5b0179ffe2ba655ffad5d75b743311f92601","observation_id":"b3883893-5b76-4d5c-a712-3e810113d082","resolution":{"observed_at":"2026-08-11T16:45:44.711987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.715548Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.715548Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:3b84d6bc5938a875636afe64ffc82c069aa2e54ed8677785f657546b919d116e","observation_id":"7821a4e7-f3e3-4e19-926c-50d9ee9197ce","resolution":{"observed_at":"2026-08-11T16:45:44.715548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15421","last_updated":"2024-11-26T13:25:34Z","snapshot_observed_at":"2026-08-13T23:49:26.123194Z","submitted_at":"2024-11-23T02:53:08Z","title":"OphCLIP: Hierarchical Retrieval-Augmented Learning for Ophthalmic Surgical Video-Language Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15421","snapshot_observed_at":"2026-08-11T16:45:44.719020Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.719020Z"},"links":{"cited_paper":"/paper/2411.15421","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:36931ceec293435119b3eec59755861aa18546740e41e04124146a1167bc763b","observation_id":"4a80bfb5-b0b2-4573-94b9-876f2eb89f3b","resolution":{"observed_at":"2026-08-11T16:45:44.719020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.428390Z","title":null,"venue":null,"work_id":"13c1869a-0603-46ea-92a5-defb9088cc17","year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.726564Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:e35817b629f14d80a53b2764f085b231a4a578ea2a9b2a8ec6367b6e5e9e671e","observation_id":"bce94d8c-11e7-4d67-beda-510fc5ad6544","resolution":{"observed_at":"2026-08-11T16:45:45.431894Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1411.2539","last_updated":"2014-11-10T19:09:41Z","snapshot_observed_at":"2026-08-14T23:12:14.296355Z","submitted_at":"2014-11-10T19:09:41Z","title":"Unifying Visual-Semantic Embeddings with Multimodal Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.2539","snapshot_observed_at":"2026-08-11T16:45:44.730495Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.730495Z"},"links":{"cited_paper":"/paper/1411.2539","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:354b36ff7f69161d6ac46d02aae670d3ffadbe4a3a1be2aea27166e9257198e4","observation_id":"34dbc0fd-30fc-44bf-afd8-40fdd24a42f4","resolution":{"observed_at":"2026-08-11T16:45:44.730495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.736267Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.736267Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:5390894903cb6290f672ffaef0143ae4bbefbbeb0215df885ef8e1ff5d76c273","observation_id":"5d6d876d-f52e-4c50-b6bc-c7d7e7457558","resolution":{"observed_at":"2026-08-11T16:45:44.736267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.740539Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.740539Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:de971df36c48ed482b0944d11745f58fb8aa1d698916d196605a2333de4f8e3d","observation_id":"a09af1a3-2b9b-46bd-ac49-81e4258ca51d","resolution":{"observed_at":"2026-08-11T16:45:44.740539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-08-17T03:02:06.550157Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-11T16:45:44.743967Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.743967Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:eef27dbabc706c104cfcc58e6b311c5e6e65618d2c18ecc12bf3913cf25053c6","observation_id":"0f706992-c754-4cc4-8ed3-cfa581e8a94e","resolution":{"observed_at":"2026-08-11T16:45:44.743967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.405573Z","title":null,"venue":null,"work_id":"25f88f30-5a72-4952-988e-6af58e2757cd","year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.747739Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:0ae07d31f71b1b4ef5581884fc146c27b29a5d685cef324158a6d8fdedd8397b","observation_id":"3d81ac7a-ff0c-4cff-8b33-21f531c92a70","resolution":{"observed_at":"2026-08-11T16:45:45.409110Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-11T16:45:44.751352Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.751352Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:9d45f964a8c1cc5c749f9bb3cae9cc0a6ab5920f41baac1ddecf3ee0ee0f11d0","observation_id":"9bc62403-be46-45df-b7b9-ac5c02775dc1","resolution":{"observed_at":"2026-08-11T16:45:44.751352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.395222Z","title":null,"venue":null,"work_id":"75aa3340-c27f-4101-97c8-a580d9910c40","year":2021},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.755283Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:a44bfbecffbf85910ea675d9c40019093bf67a92f920bf8b376982f29d67ab92","observation_id":"620194f9-467b-4a8a-85a8-c0e622fdbf23","resolution":{"observed_at":"2026-08-11T16:45:45.398877Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.758732Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.758732Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:996510fb55dea7c7a0b3c7b60162d27040106fe7ddb2951ebf152b5a94a33d9f","observation_id":"e42b04e2-881a-4cf1-9295-94638494492f","resolution":{"observed_at":"2026-08-11T16:45:44.758732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.762111Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.762111Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:2131ff46300fd4c7dad6981793044f2cfd2fac399d57030866c09dc8d665c2eb","observation_id":"76bb4713-f1db-4249-a7d3-f824a59d7501","resolution":{"observed_at":"2026-08-11T16:45:44.762111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.765864Z","title":"J.; and Yan, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.765864Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:5a0a2f851e1973839abd3eb6f0d2bd3b6d911c0e25c6c3ddec05d9268d7a2541","observation_id":"d88a1c08-ceea-4557-8d90-ebd642c51052","resolution":{"observed_at":"2026-08-11T16:45:44.765864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12705","last_updated":"2024-08-06T13:06:26Z","snapshot_observed_at":"2026-08-16T14:57:08.521037Z","submitted_at":"2024-07-17T16:26:30Z","title":"IMAGDressing-v1: Customizable Virtual Dressing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12705","snapshot_observed_at":"2026-08-11T16:45:44.769254Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.769254Z"},"links":{"cited_paper":"/paper/2407.12705","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:70e05dbf3086dccd54d32a00d37a495060569e3af21a885ba400af8a5b2382b0","observation_id":"7b70f671-3c40-4dfb-8340-20523a88b89a","resolution":{"observed_at":"2026-08-11T16:45:44.769254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.773148Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.773148Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:1639e755c866f1ebf38eae4b2de5b6577a35abab5090004687dd4016a14c6a5a","observation_id":"b5ed5497-9a08-4ec5-b7b1-52e0524d14a6","resolution":{"observed_at":"2026-08-11T16:45:44.773148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02482","last_updated":"2024-07-03T18:17:01Z","snapshot_observed_at":"2026-08-16T13:37:39.265753Z","submitted_at":"2024-07-02T17:58:07Z","title":"Boosting Consistency in Story Visualization with Rich-Contextual Conditional Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02482","snapshot_observed_at":"2026-08-11T16:45:44.776695Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.776695Z"},"links":{"cited_paper":"/paper/2407.02482","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:7f37b537a93f389adf35541155c0117010a5a450ef90e7dc9109126254a181ca","observation_id":"2a03c5ce-a27c-4224-ad62-437f84aff12a","resolution":{"observed_at":"2026-08-11T16:45:44.776695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.363536Z","title":"???? Advancing Pose-Guided Image Synthesis with Progressive Conditional Diffusion Models","venue":null,"work_id":"59db7870-0297-4bf3-879c-55718fe56352","year":null},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.780400Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:896a9e0a3666d416fc86aeb167d36168909939d30856fe1074a0c2a0e01e9ea1","observation_id":"d74a7b21-5708-4231-a500-46c57347085b","resolution":{"observed_at":"2026-08-11T16:45:45.368028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02539","last_updated":"2025-05-26T03:47:46Z","snapshot_observed_at":"2026-08-16T13:46:10.029558Z","submitted_at":"2024-06-04T17:56:28Z","title":"Parrot: Multilingual Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02539","snapshot_observed_at":"2026-08-11T16:45:44.784099Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.784099Z"},"links":{"cited_paper":"/paper/2406.02539","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:23437a861001455835274f99815444586de449985764c303aebfac6a09b83557","observation_id":"3e395ca2-e21a-4d8c-a5a8-a44655a5da63","resolution":{"observed_at":"2026-08-11T16:45:44.784099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07117","last_updated":"2025-03-08T08:26:47Z","snapshot_observed_at":"2026-08-16T15:00:57.997533Z","submitted_at":"2023-09-13T17:55:11Z","title":"PILOT: A Pre-Trained Model-Based Continual Learning Toolbox","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07117","snapshot_observed_at":"2026-08-11T16:45:44.788078Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.788078Z"},"links":{"cited_paper":"/paper/2309.07117","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:0b3939fafe9d39b066b164c82dec3383742c52b269347d59b61e81fd107a2f99","observation_id":"34a5d01c-c8e4-45f6-aac7-c14682479013","resolution":{"observed_at":"2026-08-11T16:45:44.788078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.352922Z","title":null,"venue":null,"work_id":"2e930179-f496-403d-8343-e8198408bbc1","year":2025},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.791824Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:6c34f0397d074eb4f98291eec9749797125edd7e6fc7fd6c498d06213d6cad09","observation_id":"396e2e59-ce9f-4521-8481-8b8377aa5703","resolution":{"observed_at":"2026-08-11T16:45:45.356442Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12803","last_updated":"2025-06-11T03:20:44Z","snapshot_observed_at":"2026-08-16T13:59:29.561091Z","submitted_at":"2024-04-19T11:38:08Z","title":"TextSquare: Scaling up Text-Centric Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12803","snapshot_observed_at":"2026-08-11T16:45:44.795528Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.795528Z"},"links":{"cited_paper":"/paper/2404.12803","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:a9038369f33534eb4357b6107e4df0e2331d9503d00c9ca60691400eb99fae41","observation_id":"56b8f89a-496f-47a4-b0a1-88e60bc87b48","resolution":{"observed_at":"2026-08-11T16:45:44.795528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-17T14:39:35.607934Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-11T16:45:44.799374Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.799374Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:b53e71bdae080aa23e0c607708fd52bb2679b2a7d55719cede7eefee65bb2d0c","observation_id":"642c7b47-686e-4b37-9202-3497554fc21a","resolution":{"observed_at":"2026-08-11T16:45:44.799374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.341798Z","title":null,"venue":null,"work_id":"9e4d4be5-a0cd-40bf-9442-e601db7b4162","year":2025},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.803209Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:097c62a1f17abbe232ea00ac737b6801d6795b6107902442ea96724de6cab952","observation_id":"442acfa7-1bd9-4235-8824-f33b9a04493c","resolution":{"observed_at":"2026-08-11T16:45:45.345348Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.330570Z","title":null,"venue":null,"work_id":"d0414ff7-3e41-42cf-9f67-1729d9eddf71","year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.806264Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:8c2fe58eb9018160981d37ee9a2f7fa5eaf5194578df40a5b449e945f48abe8c","observation_id":"c3ab9fa4-b95d-4483-8a88-3c089406603b","resolution":{"observed_at":"2026-08-11T16:45:45.334384Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.319771Z","title":null,"venue":null,"work_id":"30fcf1f2-3f6c-43d9-b670-63b5bbe0febe","year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.809370Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:2a9029a02e00fe52079b7be74e151ee2e821813929084f336828f2c9bdc6c7b0","observation_id":"56a4b260-275a-45f5-b687-9d6ec4439724","resolution":{"observed_at":"2026-08-11T16:45:45.323492Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.812686Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.812686Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:4b3dab4d5744abc22d12ce9fe14e50f377184d0cc1253b9349585bbcbddc7f48","observation_id":"83f60d85-ae1a-43ce-bfa9-083fdd2e72ff","resolution":{"observed_at":"2026-08-11T16:45:44.812686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T16:45:44.816068Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.816068Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:1f6d81c15ff97d590897c7e6c9e7f9a9f958036cc6e79c81ffcad1d21921e090","observation_id":"e68e8702-e122-46c0-9500-451de0b6bcb1","resolution":{"observed_at":"2026-08-11T16:45:44.816068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.819685Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.819685Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:07671047a4d365a0e39829a587767e5f7fdcdf3e73696f7d2b74b0c388b5262d","observation_id":"f8382428-2d73-451c-8dae-0309364dc75c","resolution":{"observed_at":"2026-08-11T16:45:44.819685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.823310Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.823310Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:8845664104526358f84706470a58b1ee9946efaed80d21933f98447f77090159","observation_id":"f71c19a6-29b3-4554-89fa-06a4eb34e964","resolution":{"observed_at":"2026-08-11T16:45:44.823310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.286691Z","title":null,"venue":null,"work_id":"726f5f6f-879a-4e33-a630-b48c0e891054","year":2022},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.826541Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:1366bf24ee3e7aa1515102026c3557269e146088ec6d3190f60dfdb8ac8af52f","observation_id":"fc69dfbd-bff1-487c-adec-93489945bde8","resolution":{"observed_at":"2026-08-11T16:45:45.290479Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20441","last_updated":"2024-10-31T03:34:33Z","snapshot_observed_at":"2026-08-16T13:14:03.783439Z","submitted_at":"2024-09-30T16:00:34Z","title":"Instance-adaptive Zero-shot Chain-of-Thought Prompting","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20441","snapshot_observed_at":"2026-08-11T16:45:44.830014Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.830014Z"},"links":{"cited_paper":"/paper/2409.20441","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:7735d3974fdbe67e8b2e74fc86bee73bd0a9660f3e8174c67e0ae7299d10e8bf","observation_id":"1b992b59-3a11-4214-8781-0888aec3cbb7","resolution":{"observed_at":"2026-08-11T16:45:44.830014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16862","last_updated":"2024-06-21T07:08:59Z","snapshot_observed_at":"2026-08-17T20:02:56.415169Z","submitted_at":"2023-12-28T07:11:41Z","title":"TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16862","snapshot_observed_at":"2026-08-11T16:45:44.833743Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.833743Z"},"links":{"cited_paper":"/paper/2312.16862","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:b3a4330d80bdeccddbe08034dbcd0780f3d6b09b63a25570aaab81985eefc11b","observation_id":"c2a20de0-3f71-458b-b134-5d1d6262bc07","resolution":{"observed_at":"2026-08-11T16:45:44.833743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.275349Z","title":null,"venue":null,"work_id":"e619a293-9bab-4876-9115-0f3eef6363b2","year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.837610Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:618224a9e36031cdda890845d4f0e9fbf8294c9bde489324ec07371c92bac594","observation_id":"5afc7bfb-70f5-45c0-86c0-7b265c26c9ad","resolution":{"observed_at":"2026-08-11T16:45:45.279234Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.840954Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.840954Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:0412562cf74e76d06c66e844d32f5f48f5eaa164e654930d7a1755c5cf68a61a","observation_id":"0695b377-4d15-41ff-9a21-6d63b07ac2d6","resolution":{"observed_at":"2026-08-11T16:45:44.840954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09968","last_updated":"2024-11-15T05:51:29Z","snapshot_observed_at":"2026-08-18T09:30:26.476441Z","submitted_at":"2024-11-15T05:51:29Z","title":"Seeing Clearly by Layer Two: Enhancing Attention Heads to Alleviate Hallucination in LVLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09968","snapshot_observed_at":"2026-08-11T16:45:44.844437Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.844437Z"},"links":{"cited_paper":"/paper/2411.09968","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:8cbcccdf56d330e5aea0e3256583bcb17d9f392193e18562366c1abee7660755","observation_id":"a995798a-d4f3-4859-90c3-06a9585b31c1","resolution":{"observed_at":"2026-08-11T16:45:44.844437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06579","last_updated":"2024-10-17T01:17:25Z","snapshot_observed_at":"2026-08-17T11:47:26.622673Z","submitted_at":"2024-06-04T13:52:54Z","title":"From Redundancy to Relevance: Information Flow in LVLMs Across Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06579","snapshot_observed_at":"2026-08-11T16:45:44.848057Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.848057Z"},"links":{"cited_paper":"/paper/2406.06579","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:0ac1f8fcf696ec38d4e075e117521e36614013546a18d3abf0386ad0649644b0","observation_id":"74983426-dfa4-4d02-85e0-4281e23a878c","resolution":{"observed_at":"2026-08-11T16:45:44.848057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-08-16T15:00:37.541236Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-08-11T16:45:44.852046Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.852046Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:20837ae97082fbb73a6aa179f606546020a4691d1c0b0fb4e1e7a8e578772eec","observation_id":"47904241-94ad-457a-85e9-7447f8ee7bd7","resolution":{"observed_at":"2026-08-11T16:45:44.852046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.257268Z","title":null,"venue":null,"work_id":"679d2bb7-2905-4556-94d6-ee927670968e","year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.856179Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:8ff6c288cab02bc5768eba036982cb803a3733833c2ec177c838915ca3d62def","observation_id":"46d43404-51d8-4228-9e7c-5db68ea67d8e","resolution":{"observed_at":"2026-08-11T16:45:45.260897Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.246027Z","title":null,"venue":null,"work_id":"48ee864e-4c03-475e-b225-5923664f5884","year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.859985Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:a0bfe3f13a6b62c038d9d3762593ba99fb4b2e3e44ef6c25f9e5df7fada9fffd","observation_id":"6ea5cc41-ee29-46f1-ba0f-10ee75153277","resolution":{"observed_at":"2026-08-11T16:45:45.249757Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.234798Z","title":null,"venue":null,"work_id":"98877177-2425-4dc6-9673-71aa5997960e","year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.863687Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:b179a36ef221003f4a47d6011e568d6a72a3cb4706dabdfcaa862d721e0cf96b","observation_id":"c4bba911-bde8-4b85-a860-85edb8eeb5a4","resolution":{"observed_at":"2026-08-11T16:45:45.238750Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.222455Z","title":null,"venue":null,"work_id":"351fbf09-7191-4522-82a0-35170e92b707","year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.867315Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:ee20cf597ed3601116cc4867a4c350a0c397d9a5819f31e6201d745f6a11e8d8","observation_id":"3478655e-384c-403c-8842-4eb1ba3418d7","resolution":{"observed_at":"2026-08-11T16:45:45.227225Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T16:45:44.870849Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.870849Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:18add3f229f1aac933de092af30044431b016526dfe510639a026d5c1bbcd7fb","observation_id":"29ae8978-1afd-4aa4-9e5f-a58527ee7e6d","resolution":{"observed_at":"2026-08-11T16:45:44.870849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T22:31:30.563092Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2412.09817."}