{"as_of":"2026-08-11T01:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f6e5283a2838a8da42d147e15c30436d981f868aa6b9b313f9a8de66d1074cb6","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:24:55.227295Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.08513/citation-record","integrity":"/paper/2507.08513/integrity","json":"/paper/2507.08513/citation-record.json","paper":"/paper/2507.08513"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.966495Z","title":"Claude v3.0, 2024","venue":null,"work_id":"11256bbb-902a-4a52-b489-c0cdcce75229","year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:26.349606Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:07f0821040524566760dd8788d824fc512164958ffcf0a291f5dd7a88d1cbe0d","observation_id":"22aedcb8-1c69-4983-b2da-fb13d0a3b8c5","resolution":{"observed_at":"2026-08-06T18:25:19.970840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03012","last_updated":"2015-12-09T19:42:48Z","snapshot_observed_at":"2026-08-07T11:28:03.211074Z","submitted_at":"2015-12-09T19:42:48Z","title":"ShapeNet: An Information-Rich 3D Model Repository","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03012","snapshot_observed_at":"2026-08-06T18:24:26.443277Z","title":"Shapenet: An information-rich 3d model repository","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:26.443277Z"},"links":{"cited_paper":"/paper/1512.03012","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:bdc2f04d453cbb7e2d7a8cbfe7b6951cf954736b9b92d0abf483fdce9e301d02","observation_id":"23ebc90b-877b-4010-9729-4f7bafea106f","resolution":{"observed_at":"2026-08-06T18:24:26.443277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:26.519860Z","title":"Spatialvlm: Endow- ing vision-language models with spatial reasoning capabili- ties","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:26.519860Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:81156d65fdd24b5571c805d6ac236a472ff3adbf584624ca1bb1f9465ec7c46b","observation_id":"ee36dacf-f13c-487a-9253-a849d2a1a051","resolution":{"observed_at":"2026-08-06T18:24:26.519860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-06T18:24:26.584334Z","title":"Allava: Harness- ing gpt4v-synthesized data for a lite vision-language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:26.584334Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:435e44768e46f3ffc6e138daa542ed607d51b825322c27dec87dbded07ac15c9","observation_id":"c74c8ca2-29e0-459b-8ba7-1b55b8ab2e6c","resolution":{"observed_at":"2026-08-06T18:24:26.584334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:50.359030Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:50.359030Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:7840e276853de5e8e98ab5645289949f2a9ff33c055387c98921e75819011e75","observation_id":"d46bf874-ec93-4731-aaae-f46aba4d136a","resolution":{"observed_at":"2026-08-06T18:24:50.359030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-08-09T16:58:20.916397Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-06T18:24:50.450996Z","title":"Spatial- rgpt: Grounded spatial reasoning in vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:50.450996Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:1ecee96fc481301ab9867bd0afc879e4993ee758e06b2af283f4639a0538a23d","observation_id":"a214032c-b48a-448e-b668-586e250128f4","resolution":{"observed_at":"2026-08-06T18:24:50.450996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:50.501932Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:50.501932Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:3129a2cfdce0547f6696a0be6de39a5437ce5582746d53738b565010ff757d01","observation_id":"e78d2225-ca41-4d40-9ac2-964e0bcdc054","resolution":{"observed_at":"2026-08-06T18:24:50.501932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:50.640240Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:50.640240Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:44aa5c1106f12c8dbedae4d4684a98f69e3fc684d75f1fdbb35354ae05bd3d43","observation_id":"c0a5888e-9cac-4437-b9ef-a5f1d2f6639a","resolution":{"observed_at":"2026-08-06T18:24:50.640240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.899514Z","title":"Objaverse: A universe of annotated 3d objects","venue":null,"work_id":"4feeb1e2-7460-4265-8f14-fdcf769aa0e4","year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:50.721353Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:1f6f3d30dcab7692bd7216236e7cc87ff59d80dfbb10e2d5ba34c2d22a9f538b","observation_id":"d840d744-f67b-413a-a7ef-e6193407eb5d","resolution":{"observed_at":"2026-08-06T18:25:19.904748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.881207Z","title":"Objaverse-xl: A universe of 10m+ 3d objects","venue":null,"work_id":"00c57124-25bb-4ffd-bbe4-fc6a93ce6f07","year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:50.780968Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:9c627fb280a4de9052f394109535b4e1c9357a497566666faeea893a24d0766c","observation_id":"9ace1d4d-271b-4046-a81c-b2968a3a5186","resolution":{"observed_at":"2026-08-06T18:25:19.887292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T18:24:50.875281Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:50.875281Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:db2bf8ecdfde12ee2d45d1dd4318c6dab16487a1a49055e80d64757e36a1f36b","observation_id":"67c8ed4e-ed69-437f-8081-08a895706f20","resolution":{"observed_at":"2026-08-06T18:24:50.875281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01487","last_updated":"2025-02-05T09:06:42Z","snapshot_observed_at":"2026-08-05T04:29:05.120535Z","submitted_at":"2023-11-02T15:36:12Z","title":"What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01487","snapshot_observed_at":"2026-08-06T18:24:50.966995Z","title":"What makes for good visual instructions? synthesizing complex visual reasoning instructions for visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:50.966995Z"},"links":{"cited_paper":"/paper/2311.01487","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:2e2159f3ad23ae9071c638796dfbb918175597f4e136e17e74ad02f8b9b52ad7","observation_id":"e86d4e51-015f-42ad-bb9f-5d43029e79b4","resolution":{"observed_at":"2026-08-06T18:24:50.966995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03025","last_updated":"2023-12-05T08:11:34Z","snapshot_observed_at":"2026-07-06T16:57:21.997777Z","submitted_at":"2023-12-05T08:11:34Z","title":"Training on Synthetic Data Beats Real Data in Multimodal Relation Extraction","version":1},"cited_work":{"arxiv_id":"2312.03025","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.03025","snapshot_observed_at":"2026-08-06T18:24:55.706756Z","title":"Training on Synthetic Data Beats Real Data in Multimodal Relation Extraction","venue":"cs.AI","work_id":"4aa403de-a019-4a4d-919b-5cddc1ea182f","year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.055242Z"},"links":{"cited_paper":"/paper/2312.03025","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:4f0247eeb788af4c1447f8b16acfccaed5d945ec94c7435ae53a532a86ef2de5","observation_id":"336ad5c2-4776-4d06-ae92-5c7c304cd5a7","resolution":{"observed_at":"2026-08-06T18:24:55.779515Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-06T18:24:51.096889Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.096889Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:ae7c6d6b14119e09f59f605f0b113a6e4ca3e22058bad84925d2dba298871574","observation_id":"4e757f10-5bb8-4a03-bdcd-822a6fc97c6c","resolution":{"observed_at":"2026-08-06T18:24:51.096889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.862706Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"fd172664-a6f5-4d7d-8158-57c399ef7f09","year":2017},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.180173Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:8c78a1fdbd136470042bf8831d8708e0acdd67f31f7d4fc9353b4bea8773db1a","observation_id":"c730f22a-0a89-4e9e-8226-a4143ac99b18","resolution":{"observed_at":"2026-08-06T18:25:19.868412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.843451Z","title":"Kubric: A scalable dataset generator","venue":null,"work_id":"d6789580-b938-4410-b993-4ae5f7237d67","year":2022},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.252372Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:06496dd63c10774dd651cc11c8d97164e1c9ad87624328e295f90b74be088c16","observation_id":"5dd674ed-5472-40dd-b3fa-5fe03143854e","resolution":{"observed_at":"2026-08-06T18:25:19.852158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.826058Z","title":"Regiongpt: Towards region understanding vision lan- guage model","venue":null,"work_id":"2f60d284-e736-41ef-98ca-b206f2384881","year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.328234Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:5dedd2cdc458972752b560dd2546e46c40a09865c8c19c8da229f9a286b2f173","observation_id":"9356ccb3-194f-4f3a-b89f-5c7733380849","resolution":{"observed_at":"2026-08-06T18:25:19.832620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.807713Z","title":"Lvis: A dataset for large vocabulary instance segmentation","venue":null,"work_id":"a2e9d351-4056-4e76-bb74-255892f350a7","year":2019},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.398073Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:f12cad6292db23b193ece59f06e06bc8300aaae9d4ab3e0f1e89d65a5c253d34","observation_id":"953075ef-eae8-48c0-b500-13bd6b9b84be","resolution":{"observed_at":"2026-08-06T18:25:19.814743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:51.445774Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.445774Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:6ff1d0ccab65dc44ff8d9807d327ceb87587980d43613669c6f8267972757dd8","observation_id":"4cacf1a3-b313-423c-a996-4dda7392e2a0","resolution":{"observed_at":"2026-08-06T18:24:51.445774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-06T18:24:51.489571Z","title":"Prompt-to-prompt im- age editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.489571Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:04c05296e5ad55744d38c3c3a9b54c55e05d83e740705c55fc54624d3e9ea10e","observation_id":"9577be88-486f-4125-b157-813f5b0e6346","resolution":{"observed_at":"2026-08-06T18:24:51.489571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-06T18:24:51.541947Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.541947Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:45b180a26215098bac64b07c953aa37a35e32d080a6411e7eaf9204a643b24b2","observation_id":"2bf75061-9736-4928-9110-4fe24c39642c","resolution":{"observed_at":"2026-08-06T18:24:51.541947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:51.592721Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.592721Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:f9ce97cf78aaf57807b6a4bf01f120f93bde4171b5f72d7bbb47478cf0df7a4f","observation_id":"75415d62-cf08-44fe-a973-1581acc6461e","resolution":{"observed_at":"2026-08-06T18:24:51.592721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:51.640713Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.640713Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:9f1af6ed868a0d3de27d2c9c8ae40132880fcc5ae98eba08e0e21852cefd85ab","observation_id":"04d06e66-6699-4701-9838-9557421ee249","resolution":{"observed_at":"2026-08-06T18:24:51.640713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.751251Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"de8cd998-aa13-4e41-8897-2d067413ff24","year":2019},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.712219Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:44e7fc74f155f9544b3de782c3dc1febc2932b9f46800eea04977c7293373873","observation_id":"31ab4b62-2a33-42f6-898d-1e9c7a8e186b","resolution":{"observed_at":"2026-08-06T18:25:19.756961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.727597Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":"d5874611-b440-4e36-a256-e079914155ae","year":2017},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.765806Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:4e05fbf640318828a16a675e78aa1fc8defebd5477c94cffcfbf2419ec32de4b","observation_id":"089ba357-1387-443c-8879-f522d36d1506","resolution":{"observed_at":"2026-08-06T18:25:19.739583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:51.825630Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.825630Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:1d9daa8d3a51f3520d1cc78c0a3db0f0fcf2617aa505e4dd6a0fb1ce50f1e05f","observation_id":"095a08c1-e4e2-4643-8893-59ab52b7ae9d","resolution":{"observed_at":"2026-08-06T18:24:51.825630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03471","last_updated":"2024-10-17T15:12:44Z","snapshot_observed_at":"2026-08-05T08:34:20.852488Z","submitted_at":"2024-07-03T19:36:33Z","title":"Learning Action and Reasoning-Centric Image Editing from Videos and Simulations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03471","snapshot_observed_at":"2026-08-06T18:24:51.875150Z","title":"Learning action and reasoning-centric image editing from videos and simulations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.875150Z"},"links":{"cited_paper":"/paper/2407.03471","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:18404b99cda1cc1bf2e12c86f1d3762ce04aeccbdb8d2ab10668e1ce40ea7ca2","observation_id":"8614b7fd-4116-423d-9fa5-881825ac47d2","resolution":{"observed_at":"2026-08-06T18:24:51.875150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T18:24:51.915011Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.915011Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:c00248dea8cc7cf3280e7ef539aeea1e4cb80d25857b9e1418cc244d302f9ec2","observation_id":"b730cbda-5bef-43f6-8798-4771a4d6016f","resolution":{"observed_at":"2026-08-06T18:24:51.915011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:51.958093Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.958093Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:848ee4a434e333b60a63c654a0f22d1adf0150dc7d1348143c0be06c30ebb81b","observation_id":"0b07225c-fcd3-491d-a3f7-858971ef0997","resolution":{"observed_at":"2026-08-06T18:24:51.958093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-08-06T18:24:52.066023Z","title":"What if we recaption billions of web images with llama-3? arXiv preprint arXiv:2406.08478,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.066023Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:9cb7987d67010c1d791f33639b79fd562b1875d25914fb64d7682fd4d5d63f6b","observation_id":"a10dd858-9346-4875-933a-7566f1fd5aac","resolution":{"observed_at":"2026-08-06T18:24:52.066023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10253","last_updated":"2023-12-28T03:44:28Z","snapshot_observed_at":"2026-07-06T16:08:13.029564Z","submitted_at":"2023-08-20T12:43:52Z","title":"StableLLaVA: Enhanced Visual Instruction Tuning with Synthesized Image-Dialogue Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10253","snapshot_observed_at":"2026-08-06T18:24:52.156204Z","title":"Stablellava: Enhanced visual instruction tun- ing with synthesized image-dialogue data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.156204Z"},"links":{"cited_paper":"/paper/2308.10253","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:dee95372e2d90c756465f2a1c0c639072e12bce1bf932a9547f55601cf966443","observation_id":"e92f5ebe-1327-4337-bc68-0d2a152b7e54","resolution":{"observed_at":"2026-08-06T18:24:52.156204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.683170Z","title":"Vila: On pre-training for vi- sual language models","venue":null,"work_id":"c2398517-2907-4557-b3e2-cccf7e5bf8cc","year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.337217Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:2081cc9bc18964706a3a5095adcad4aadcc4dffea7be2163975fd9281bf78220","observation_id":"b9b3ccb0-a351-44e7-9cea-820c995e8ae4","resolution":{"observed_at":"2026-08-06T18:25:19.687602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:52.445832Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.445832Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:d2570ce869b1e720b96a112181cefa5e6603d26b7db1ecd6d3c303ea595390a0","observation_id":"f35e224e-dd1e-4a27-b02c-93a3aee0d20e","resolution":{"observed_at":"2026-08-06T18:24:52.445832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.653837Z","title":"Visual spa- tial reasoning","venue":null,"work_id":"9718c6dc-1018-48fd-b72e-c91454ae3138","year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.521478Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:fd9865eb00e8bddc9f906ec63ca99e69e7f638a9c17ae448c7e2fa4a892adbd8","observation_id":"814c3bba-122f-4c28-9e23-cae8c89f935f","resolution":{"observed_at":"2026-08-06T18:25:19.659790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.637416Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"9d582890-71c3-4490-a2c3-3ed3cff2d153","year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.581229Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:9bd061ac759b984c01a0df7fabf02f81612051226522b418546d91619ccf2228","observation_id":"42b1530c-475b-427e-a737-908dacbf949c","resolution":{"observed_at":"2026-08-06T18:25:19.642709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:52.651502Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.651502Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:e5382660258f063ede5a38759020be3d092e415bf7bfe8748dab7eadfd16c05d","observation_id":"48815cf8-cfef-4993-a696-fbfce8c671f3","resolution":{"observed_at":"2026-08-06T18:24:52.651502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.612012Z","title":"Clevr-ref+: Diagnosing visual reasoning with referring ex- pressions","venue":null,"work_id":"0f66f4e1-3fd6-441c-bac6-4ac9214bb237","year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.714850Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:060fb1425e33b2da29529daebb85355f1ed507787be6fbf154b54858d12e38a7","observation_id":"4d370933-8331-4859-a900-570bb89c1077","resolution":{"observed_at":"2026-08-06T18:25:19.617137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20756","last_updated":"2025-08-11T14:20:55Z","snapshot_observed_at":"2026-08-04T05:33:48.921191Z","submitted_at":"2024-07-30T11:57:40Z","title":"SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20756","snapshot_observed_at":"2026-08-06T18:24:52.771144Z","title":"Synthvlm: High-efficiency and high-quality synthetic data for vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.771144Z"},"links":{"cited_paper":"/paper/2407.20756","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:a4f2286adbe239a2eb17cefbd71c30b1d46354e74242e90c85535bd5c6373abb","observation_id":"0607d074-6d96-4b08-9d9c-b9ba782c61a4","resolution":{"observed_at":"2026-08-06T18:24:52.771144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:52.830815Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.830815Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:9c6e2c111c152ce95ba31710207c4eed6bd610c16d551d5003ae6ceabeae8a49","observation_id":"ed303b27-b88d-462f-a43b-73855064240f","resolution":{"observed_at":"2026-08-06T18:24:52.830815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.584231Z","title":"Generating images with 3d annotations using diffusion models","venue":null,"work_id":"d68ecd94-508d-4f2b-85ea-69386474ac10","year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.873041Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:01b43b02000c3c51a4ad2c856519d955b828fece6785dba580d5d870755aa82c","observation_id":"ab1081b8-88ad-4e2c-802a-313c49b41b59","resolution":{"observed_at":"2026-08-06T18:25:19.588673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.565280Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"e7201d08-1e4d-4cdc-b5bb-5835278a8b98","year":2019},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.914267Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:6dcf712a81a271908c5cccccf43f2b2369f7806d6ee2566e815edec2ea041a5a","observation_id":"a6cd09cf-de71-4d48-9097-e578dad25472","resolution":{"observed_at":"2026-08-06T18:25:19.570935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.545236Z","title":"Llama 3.2 vision, 2024","venue":null,"work_id":"f8670a4b-3277-4ce3-a1df-6e15f944b6b9","year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.948441Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:35442e5e321052746d2c9282984c05a162dc9f6fa2d4ddf33b05a6eef5a147a7","observation_id":"4dd85980-213a-4cb5-871d-50e3964e5b8b","resolution":{"observed_at":"2026-08-06T18:25:19.552750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:52.982475Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.982475Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:d69b29cab99a2df8643d7e236f5fce3dc5f37092e9b01f6d839abc23ea1388dd","observation_id":"c94a93ae-c02f-4e07-a0b7-2b79fc18a6e4","resolution":{"observed_at":"2026-08-06T18:24:52.982475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T18:24:53.028696Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.028696Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:e05f14c1c79db893d574aea4018b5f083f647bb34b384f0936de834bc34e6682","observation_id":"1ae0ea9c-8307-4059-b057-82dd1cdba90a","resolution":{"observed_at":"2026-08-06T18:24:53.028696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T18:24:53.060999Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.060999Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:2d9708a076dd5da199891c476cd83b1358fab3249ca936ae4e9bdb7eabe89683","observation_id":"1661cc17-f57a-44b8-b047-43babe783fc7","resolution":{"observed_at":"2026-08-06T18:24:53.060999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T18:24:53.119915Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.119915Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:4f9b5e4ef511c3d9bc50f7eeb6a8d1eefff3f79396dc0239c28feb6cbaa1a519","observation_id":"ca9c2755-f9d7-435a-8a1f-717b50699f4e","resolution":{"observed_at":"2026-08-06T18:24:53.119915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.518427Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"b0c7cdbe-3070-4182-b49f-3f9e9fc4884b","year":2022},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.198135Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:78368955055b1eb03c17f957330fedc288c11a1144295209d82cb61f5bac8197","observation_id":"4052a144-3fa7-4a01-a69c-8fa3c4b4411a","resolution":{"observed_at":"2026-08-06T18:25:19.524957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:53.303467Z","title":"Imagenet large scale visual recognition challenge","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.303467Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:9aebbd761dff413484258d4609a9142dc4d4bf1fff986def5ab85f886542c0cb","observation_id":"dd505345-76be-404b-9b10-275b36819337","resolution":{"observed_at":"2026-08-06T18:24:53.303467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:53.390031Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.390031Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:80e2bbd5c335efa8bfb8872a07bd25ec878abb1b4cf57367d415d9f1bc2f9b57","observation_id":"9875cc28-2f98-468c-a8d9-b47623ed61cb","resolution":{"observed_at":"2026-08-06T18:24:53.390031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07750","last_updated":"2024-06-07T12:10:47Z","snapshot_observed_at":"2026-08-04T21:07:04.374644Z","submitted_at":"2024-03-12T15:36:42Z","title":"Synth$^2$: Boosting Visual-Language Models with Synthetic Captions and Image Embeddings","version":2},"cited_work":{"arxiv_id":"2403.07750","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.07750","snapshot_observed_at":"2026-08-06T18:24:55.402733Z","title":"Synth$^2$: Boosting Visual-Language Models with Synthetic Captions and Image Embeddings","venue":"cs.CV","work_id":"3f39b854-1a17-4b27-9e53-146aafb0f685","year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.424779Z"},"links":{"cited_paper":"/paper/2403.07750","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:3a1299010fa786275486355e38d219f8d14b0c711d280619557c9916e906253c","observation_id":"d002c5df-03fe-4763-a28f-23eee2621d6b","resolution":{"observed_at":"2026-08-06T18:24:55.438877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:53.489465Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.489465Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:b853d7df6f1faef5c8915d0db9119e74e79321293c6449547d2eef918e4bd0bb","observation_id":"d4797100-dcb6-4087-bc71-4461a0599388","resolution":{"observed_at":"2026-08-06T18:24:53.489465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T18:24:53.538670Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.538670Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:c08d694972b569d43b273b13014550362f3300052dfb611378af68d72454fa82","observation_id":"b8aa1ea9-f8e2-4318-9320-7e0eb3c59cde","resolution":{"observed_at":"2026-08-06T18:24:53.538670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-06T18:24:53.577193Z","title":"Cambrian- 1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.577193Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:6a3e08908505bdcc30f99a336a4e18ec6ca387b17ea4b5b12ebed4d5adffa56f","observation_id":"c9d583e9-9e00-4bba-96a4-659e5838cd43","resolution":{"observed_at":"2026-08-06T18:24:53.577193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.438407Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"e49362eb-b7bb-4fa0-b66c-b0cc4c8195ca","year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.637886Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:a76b482e1ed985aa93e620c6293101b58cbd456eb5a990861161f0931bdcd6f8","observation_id":"4b332fb1-d509-4478-b476-b450b80f5090","resolution":{"observed_at":"2026-08-06T18:25:19.451740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T18:24:53.692677Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.692677Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:0cea26b565e8378208adef0b38bc6c883d0452d62f6b11a348b1ba40e302e0fe","observation_id":"57934c97-273e-42da-9534-3393f50de742","resolution":{"observed_at":"2026-08-06T18:24:53.692677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-06T03:52:00.226360Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-06T18:24:53.783559Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.783559Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:730334b31bf4f5dad2fe889c26d7232a3b278275c375c7690c8a4359894b3897","observation_id":"0e37eb4b-4166-45b0-b6df-e75df5fd21a9","resolution":{"observed_at":"2026-08-06T18:24:53.783559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.406078Z","title":"Imagen editor and editbench: Advancing and evaluating text-guided im- age inpainting","venue":null,"work_id":"4eecbd52-441d-468d-857e-090be47a7e0d","year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.842559Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:5d57d44170a42ad3c0d39c07a118d1b68da4e314bdff8baf5ee4edb698d9b27f","observation_id":"8423d23e-82ee-47e6-9527-49274baf82e9","resolution":{"observed_at":"2026-08-06T18:25:19.419298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.380615Z","title":"Mebow: Monocular estima- tion of body orientation in the wild","venue":null,"work_id":"b4e2d86b-c6a6-4a6f-b4d1-57c9dfc7b6c8","year":2020},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.966799Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:59b629441f966cc249632576627c26143829e66e9e3bfbee422f6f051cd8edb6","observation_id":"fd5b5f6f-9e11-4231-831c-620c733cfe23","resolution":{"observed_at":"2026-08-06T18:25:19.390347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:57.733599Z","title":"Beyond pascal: A benchmark for 3d object detection in the wild","venue":null,"work_id":"d7826fa3-e412-4c06-b836-7139e88cbdbf","year":2014},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.042393Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:2e80e0c4af3aca548e08c53104230c3dff97faf7cba7be676948a905142ed864","observation_id":"03e92d3b-bf6b-4034-992f-3cc3dd659b52","resolution":{"observed_at":"2026-08-06T18:25:19.090317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:57.383092Z","title":"Imagere- ward: Learning and evaluating human preferences for text- to-image generation","venue":null,"work_id":"9479ecdd-adaa-4d0a-88ba-6db78b36ff27","year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.129706Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:60fa232b1cc9b7ca0f465571b951cdf6d8d1601e4933cb687d1ee25182bdca23","observation_id":"117e2623-f045-42d3-91da-bc5c6bedd6b6","resolution":{"observed_at":"2026-08-06T18:24:57.505282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-06T18:24:54.208155Z","title":"The dawn of lmms: Preliminary explorations with gpt-4v (ision)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.208155Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:99f707d73c8cd528880277f450ef6f97b9e90b6711f7757f53b2304952b6f7ce","observation_id":"1a3ab2d6-e4ce-4703-be7f-c99d03379062","resolution":{"observed_at":"2026-08-06T18:24:54.208155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:54.285272Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descrip- tions","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.285272Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:0c39c852f4f1da0c9fec89f58ae8583d83be72069be8738237172448ff351743","observation_id":"6a79d9d7-e38a-465d-85c8-7c341d6176ed","resolution":{"observed_at":"2026-08-06T18:24:54.285272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:57.226310Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":"889aee6e-22e7-4eec-aa79-39b4b4396bd4","year":2016},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.353308Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:b43c249cedee50c9d37c8caf4b04b35dba5bf11649fc70f9e27f89703dc4689e","observation_id":"a1ae6438-1357-4865-a2aa-6fea4b191f89","resolution":{"observed_at":"2026-08-06T18:24:57.281558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01936","last_updated":"2023-03-23T23:21:38Z","snapshot_observed_at":"2026-08-10T14:28:08.728516Z","submitted_at":"2022-10-04T22:13:25Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01936","snapshot_observed_at":"2026-08-06T18:24:54.449939Z","title":"When and why vision- language models behave like bags-of-words, and what to do about it? arXiv preprint arXiv:2210.01936, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.449939Z"},"links":{"cited_paper":"/paper/2210.01936","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:34fbf14de2a03f53bfb245eae12a7ebcf8887c9a2ed80e03beb9d3b1bce31364","observation_id":"720d82eb-b1da-4161-9cf6-1fba16e76b26","resolution":{"observed_at":"2026-08-06T18:24:54.449939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:57.108001Z","title":"Magicbrush: A manually annotated dataset for instruction- guided image editing","venue":null,"work_id":"5df4317f-a317-4a5d-b502-19fc6f9f28f2","year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.528019Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:a84eb08930a902da2c4f04090e7738f7872dac45cb91fa5b9769f8c4dff35229","observation_id":"63f700ad-48dc-4077-98d8-270a195668c4","resolution":{"observed_at":"2026-08-06T18:24:57.170158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:56.982515Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"f8a320cf-14ee-46a5-ab54-088b9c0255eb","year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.606014Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:380d916e1fd0e6dcf56eaf5a66cc65770d3cbc63d0ad39f0015f7ccedd1e1b47","observation_id":"8f26794e-2a13-4c39-9435-d62985f49828","resolution":{"observed_at":"2026-08-06T18:24:57.037280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-06T18:24:54.680277Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.680277Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:1162f6bf569719fb2027550da9340af5b02f68187dbe0bd2cf8ec3263c004805","observation_id":"40b253b0-067d-4f80-b54f-90b17167e97a","resolution":{"observed_at":"2026-08-06T18:24:54.680277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-06T18:24:54.749240Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.749240Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:7db1b09ecdc40775213052886cd349311da015e680c6a297f70d4d630d69472f","observation_id":"c59fd0ac-0659-49c7-88c2-f56a3efe1277","resolution":{"observed_at":"2026-08-06T18:24:54.749240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:56.856713Z","title":"Semantic under- standing of scenes through the ade20k dataset","venue":null,"work_id":"fa9304db-6483-4ed0-8c12-8ffdb4efd68c","year":2019},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.790724Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:586890c7efa390734d2e866235685b29a82723baa0596ce46866de2608afa0dd","observation_id":"f97af725-1353-4477-a6e1-299e62af70b7","resolution":{"observed_at":"2026-08-06T18:24:56.904192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:56.773027Z","title":"Corresponding section in main paper is Sec","venue":null,"work_id":"043f8bb9-fab4-4c5d-adaa-05ad4a7fa3c2","year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.830972Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:f050f6aaa5ff86de87c848cf631fb190bea9d2cdcfb154c627a75e26cb277fc9","observation_id":"7931a257-a464-4c0c-b3df-4fbbc23f9357","resolution":{"observed_at":"2026-08-06T18:24:56.816980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:56.703353Z","title":"front\" also means","venue":null,"work_id":"8894b8fb-676e-47eb-80b4-6053d91dd098","year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.869213Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:4fc8a2ba478e3d76fd3b8074febdb1bb84af233ca0df57b1e98d632cba7ff4f7","observation_id":"4260af33-793b-4be7-b525-314b47663afb","resolution":{"observed_at":"2026-08-06T18:24:56.728795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:56.606744Z","title":"SYSTEM_PROMPT_FOR_GRADING_MLLM_RESPONSE =’You are a helpful and precise assistant for checking the quality of the answer","venue":null,"work_id":"b27864cf-11ff-485c-824c-bbc616c1aee5","year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.929420Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:b3c6344ebdf5dcf86bcd0f1a18a5507f2d8c8153f5bb7dff2bbed3a4ece8a771","observation_id":"662fd4c4-96c5-4aa1-a11b-8950e0b57382","resolution":{"observed_at":"2026-08-06T18:24:56.651563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:56.512832Z","title":"6, we show an example of using ImageReward [60] for the dataset curation by evaluating the alignment be- tween generated image and text prompts","venue":null,"work_id":"f51c4e60-e95f-4dc5-9e5c-631a933392cc","year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.992499Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:a99b20273e52596f410ade0a56363582c1c13beceedf7ea4f3c1e146cb59ab4c","observation_id":"11274d10-18db-4291-b450-0af94b271366","resolution":{"observed_at":"2026-08-06T18:24:56.549201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:56.434611Z","title":"3, we perform quantitative comparisons on general image visual quality between different DM backbones: SD V1.5 and SDXL","venue":null,"work_id":"f0e8ceaa-591c-4bcd-bc0b-8efd6967ee6c","year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:55.032116Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:df903040f28ec71db04998117b7d8c465a83ab7fa4ab14205d4973f3094dcaa3","observation_id":"a833ed89-9c6d-4823-a8ec-80624261cff8","resolution":{"observed_at":"2026-08-06T18:24:56.468624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:56.368029Z","title":null,"venue":null,"work_id":"e42ad0e9-abba-49e3-b4d5-bdecf9ef9383","year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:55.074253Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:2c5443fd568c163e0332e8c269b43f10b4b17214d0bf370037d0fbb51bd57124","observation_id":"d8e97d91-b1ca-4777-87d7-625d4fce5795","resolution":{"observed_at":"2026-08-06T18:24:56.391242Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:56.296290Z","title":"9 shows the UI page of our user study","venue":null,"work_id":"35cf2119-3372-4411-9d13-3c797fba4482","year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:55.116586Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:e3944c0a46ebe53d73966b84864ad4d7b112adc46752b63c8f06deb2a7c3c4e3","observation_id":"6fd6cb42-cbf1-427b-a8aa-f8f26501081d","resolution":{"observed_at":"2026-08-06T18:24:56.320779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:56.229556Z","title":"10 to show more qualitative comparisons between fine- tuned LLaV A model to commercial SOTAs","venue":null,"work_id":"f33126cf-6977-43e9-a32f-ca4b37885ff9","year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:55.153359Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:367a788e14741668e65ee60ea5fa78ce08f25c9112fee5ba42e26ebc2875efe1","observation_id":"f80025b9-0df0-4d73-a614-011c00d5989c","resolution":{"observed_at":"2026-08-06T18:24:56.259557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:56.127267Z","title":"11, we shows more examples of diversity on object categories, camera-object relation, and background con- texts","venue":null,"work_id":"cce584e0-7e06-4304-9786-0d42c422b788","year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:55.177843Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:9c568dc121d657e8b9b192510fbce5741f1937a7ae51f6d70b136524d8d4915e","observation_id":"ce8877c5-f5bf-41fc-b1a7-c7c842b22480","resolution":{"observed_at":"2026-08-06T18:24:56.181755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:56.047671Z","title":null,"venue":null,"work_id":"55d500b1-329c-49d5-88a0-3121b92bd089","year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:55.205611Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:718fab3182f832e3c3406c023fe8fd0d8bc1a358cfb46e316835dcff17fbe6c8","observation_id":"7b09579b-8e9e-4749-9a60-76040f022433","resolution":{"observed_at":"2026-08-06T18:24:56.077268Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:55.947647Z","title":null,"venue":null,"work_id":"0e0b49dc-f32f-4f2c-81df-3c32d2067d46","year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:55.227295Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:ee5d32be1ee19091a1c4058929507da8ead847e9b74c41030244f1b4bd8ee49d","observation_id":"ad2ed1f9-ff4d-4f55-9408-d2fbb7629d6e","resolution":{"observed_at":"2026-08-06T18:24:55.986032Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","latest_version":2,"primary_category":"cs.GR","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":2,"verified_fuzzy":34},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 0 inbound Pith citation observations for arXiv:2507.08513."}