{"as_of":"2026-08-17T14:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7578ba63f6cfbd75fe823186aa2a68125857e70bdccf7ba7548224f51b2a6846","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:49:27.726009Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T17:42:49.902997Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T17:43:45.778447Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"cited_work":{"arxiv_id":"2412.07518","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07518","snapshot_observed_at":"2026-06-29T17:43:45.778447Z","title":"Hallucination elimi- nation and semantic enhancement framework for vision-language models in traffic scenarios","venue":null,"work_id":"dedd208c-8d60-4274-bb9d-1f094fcbd52c","year":2024},"citing_paper":{"arxiv_id":"2605.27038","last_updated":"2026-05-26T13:56:31Z","snapshot_observed_at":"2026-08-16T13:12:38.040448Z","submitted_at":"2026-05-26T13:56:31Z","title":"TPS-Drive: Task-Guided Representation Purification for VLM-based Autonomous Driving","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T17:42:49.902997Z"},"links":{"cited_paper":"/paper/2412.07518","citing_paper":"/paper/2605.27038"},"observation_digest":"sha256:bdb59485470c20c88f05b7b7c551afbe336f5c6b9df1afd83fe1f8b6441739d5","observation_id":"b38fe928-87d4-47db-943c-ad196390170f","resolution":{"observed_at":"2026-06-29T17:43:45.780075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.07518/citation-record","integrity":"/paper/2412.07518/integrity","json":"/paper/2412.07518/citation-record.json","paper":"/paper/2412.07518"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:27.474923Z","title":"Traffic sign interpretation via natural language description,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.474923Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:5cb69770d18be2a878f7918c2d9757ad33bf7a021cb952836c4b66de52f0ca75","observation_id":"560253cc-ca3f-41d5-a44f-6449f53628e0","resolution":{"observed_at":"2026-08-11T18:49:27.474923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:28.480850Z","title":"Vision-language models can identify distracted driver behavior from naturalistic videos,","venue":null,"work_id":"eb6b31eb-2910-4c0a-b2a4-17bb38d2289b","year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.480517Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:5eb3a070dcca5bf797b34828f5d4ce47e2ce1b870566b15fb315e7ab8a02d90b","observation_id":"d519cbc4-824d-44fc-b9a4-ecd87af6c8a3","resolution":{"observed_at":"2026-08-11T18:49:28.486113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T18:49:27.485882Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.485882Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:422a8974665dd1fb77d139b0328d85e0be4a31cd50922c09dd4ba710ada3996c","observation_id":"22688284-3a6b-4680-9a28-6061611cad03","resolution":{"observed_at":"2026-08-11T18:49:27.485882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-15T17:00:20.282987Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-11T18:49:27.491807Z","title":"Llava- o1: Let vision language models reason step-by-step,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.491807Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:55765cd82e04b70eb815509a9a3583b239b57ac18f5e9474965717b2a28c8a56","observation_id":"ea053f42-3b4a-4dfc-b2e4-d064e5d7d6f4","resolution":{"observed_at":"2026-08-11T18:49:27.491807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:28.464835Z","title":"Traffic scenario understanding and video captioning via guidance attention captioning network,","venue":null,"work_id":"9bd199f7-072d-430a-9498-91de13e0a21b","year":2023},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.497183Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:bdf6b1d4579c32bdec295f00a74edb83cbd58b14211ec2ce74f45868807f3c56","observation_id":"d8aa0cf9-4803-4dca-9b76-e509cf6e7709","resolution":{"observed_at":"2026-08-11T18:49:28.470772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:28.447477Z","title":"Nle-dm: Natural-language explanations for decision making of autonomous driving based on semantic scene understanding,","venue":null,"work_id":"a70fcf64-b25b-4e94-b18c-6221c590cf78","year":2023},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.502854Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:31bd4928c3f1d06ded90c7e6b2d033ea1eb64ad98d138131a7bdfbcf78425514","observation_id":"39e60695-488d-4931-924c-c7206c657fc8","resolution":{"observed_at":"2026-08-11T18:49:28.453183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:28.430604Z","title":"The crossroads of llm and traffic control: A study on large language models in adaptive traffic signal control,","venue":null,"work_id":"02258ab1-07f7-44d0-a0a0-9064a9cc60f9","year":null},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.508707Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:1569b37405e62f7bfd9782031566511c925cf039402a424dd7e42b9ad665a401","observation_id":"007420f7-b3c3-4a70-b4f9-527f3e7e347d","resolution":{"observed_at":"2026-08-11T18:49:28.435605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:28.414610Z","title":"Adapt: Action-aware driving caption transformer,","venue":null,"work_id":"6349cb2a-3f51-4255-aa51-e19dd3f7cafc","year":2023},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.514219Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:af63ccfc19d69c004f4e8f99ef45f0ee7c6d1a5656851e42d09d5779d9a60669","observation_id":"e9bfdc2b-c3f1-408d-bd7d-b2e876ddc66e","resolution":{"observed_at":"2026-08-11T18:49:28.419410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-08-11T18:49:27.519247Z","title":"Hallucination of multimodal large language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.519247Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:feac568abd75ce068421a22a3a1935469e6c46ebff709251cee45f61e023b7c3","observation_id":"4caad00b-57f0-489b-84b3-60a8fce37082","resolution":{"observed_at":"2026-08-11T18:49:27.519247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:28.399393Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning,","venue":null,"work_id":"9600d367-2521-4fa4-ad71-f179d7ce6deb","year":2023},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.525526Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:33204af1ed23829e57947794b223b3486def4787c49dccb388b57f3b4200689d","observation_id":"ea11c981-cc66-47c4-a342-9d8ba91785c9","resolution":{"observed_at":"2026-08-11T18:49:28.404672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:28.384986Z","title":"Hallucidoctor: Mitigating hallucinatory toxicity in visual instruction data,","venue":null,"work_id":"23f675d3-f500-47bc-b07b-21303aa1e6ec","year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.530323Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:9356f9e5e1e8822926c539f9d1bde80da4f937c461e13ed3bed37e258c059215","observation_id":"e52d00c4-fe22-49f4-b55f-d71f1b6a376e","resolution":{"observed_at":"2026-08-11T18:49:28.389316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:28.371151Z","title":"Hallucination augmented contrastive learning for multimodal large language model,","venue":null,"work_id":"67ad2b0d-bc1e-4a8f-8d5d-993407785d2b","year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.535319Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:9686d3b06649af4e20e8400620e0aa380aed5b058908ed93e33c63a85e9b7ea1","observation_id":"14cfca7f-30b6-4f5a-a70e-d181a404543f","resolution":{"observed_at":"2026-08-11T18:49:28.375199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-08-15T23:42:34.277075Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-11T18:49:27.539818Z","title":"Aligning large multimodal models with factually augmented rlhf,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.539818Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:d820d6a3859d171c2abdd1a3e6fe6c31beb981b1117940f35157629130459315","observation_id":"c135c7fa-c7b2-4f6f-b957-494d442b76d6","resolution":{"observed_at":"2026-08-11T18:49:27.539818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:27.545497Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.545497Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:ceb004b3fc34a755062d9d0faf75191c54ad30ccb969cdc0fe5a291629a814c1","observation_id":"0f5f03e7-072c-41da-a48c-bee31b5b4ef2","resolution":{"observed_at":"2026-08-11T18:49:27.545497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:27.550816Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.550816Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:7784da1bc5cabde9cd3aa919793501d7159776e12f514f9798555d43e82ae16e","observation_id":"7b742577-e943-4658-8af7-6271fd7b924e","resolution":{"observed_at":"2026-08-11T18:49:27.550816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:28.338041Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration,","venue":null,"work_id":"6dd98d3c-5515-4a40-88d7-29c74da69bd0","year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.555845Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:30de2690df4b4dda668bb06e92e36982e2162bf3ac34abd2441c86508263514f","observation_id":"e3006a15-9108-4611-bf4c-69f72fb8b517","resolution":{"observed_at":"2026-08-11T18:49:28.342307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:28.321923Z","title":"Vigc: Visual instruction generation and correction,","venue":null,"work_id":"b3b14b22-8c33-4390-8bb8-08a56f6149de","year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.560406Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:ecc76153eb34abe414576cad1f97d9b4161ee4b467a45db4f9443332c00c64db","observation_id":"fa2eae24-06d0-4098-a4bb-bcea3eb779d7","resolution":{"observed_at":"2026-08-11T18:49:28.327223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:28.305940Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions,","venue":null,"work_id":"50b3f0c1-1888-4364-81bd-c56aea71076f","year":2023},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.565306Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:6a6a9e8a9ce5695fda4c2a71798d2756973eab23ab2d81806fa7f3a3a39225a5","observation_id":"217cee6b-23cc-406f-b385-a56429c77eeb","resolution":{"observed_at":"2026-08-11T18:49:28.310873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:28.291404Z","title":"Haloquest: A visual hallucination dataset for advancing multimodal reasoning,","venue":null,"work_id":"db078ef3-1b7f-4110-b428-e01d7e090d94","year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.571168Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:2b22476f4d3d0aa6712d429519bc54984aca86267836ef4db8559c8e62597995","observation_id":"9bbc8d18-5ea1-4a3f-86f2-ad8b28440dd7","resolution":{"observed_at":"2026-08-11T18:49:28.296065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03105","last_updated":"2024-01-13T15:11:04Z","snapshot_observed_at":"2026-08-16T14:29:30.651079Z","submitted_at":"2024-01-06T02:02:34Z","title":"Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03105","snapshot_observed_at":"2026-08-11T18:49:27.575316Z","title":"Incorporating visual experts to resolve the information loss in multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.575316Z"},"links":{"cited_paper":"/paper/2401.03105","citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:d4e33951ff74265c038505391ec963d7585104429e47f2dc91f3579b15b9fedf","observation_id":"8b53a5e1-f295-43fc-8c5b-cf580cde0a63","resolution":{"observed_at":"2026-08-11T18:49:27.575316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:28.275880Z","title":"Exploiting semantic reconstruction to mitigate hallucinations in vision-language models,","venue":null,"work_id":"6b4c793d-c422-41e1-9914-79e54f9d227c","year":2025},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.580404Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:9c1e0efd16b2b54c9edfa7b0bbd067cc3c852b071ecad1dc44f943af483b815c","observation_id":"69db74c2-4841-4e48-ab2e-d2e64b6e7578","resolution":{"observed_at":"2026-08-11T18:49:28.281315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15683","last_updated":"2025-03-06T03:59:59Z","snapshot_observed_at":"2026-08-16T13:49:41.323312Z","submitted_at":"2024-05-24T16:21:59Z","title":"Visual Description Grounding Reduces Hallucinations and Boosts Reasoning in LVLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15683","snapshot_observed_at":"2026-08-11T18:49:27.585104Z","title":"Vdgd: Mitigating lvlm hallucinations in cognitive prompts by bridging the visual perception gap,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.585104Z"},"links":{"cited_paper":"/paper/2405.15683","citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:b82831cd8ca8ecf5e23a11aa7c74d531cadf2e5aae34282d4985dd270310e381","observation_id":"c8d05106-4cfe-49d3-b300-cd77af4f5b0f","resolution":{"observed_at":"2026-08-11T18:49:27.585104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:28.260486Z","title":"Multi-modal hallucination control by visual information grounding,","venue":null,"work_id":"f86ce1cf-038b-448b-9d11-5e534b19be55","year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.590317Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:597a3519a8a6d288add5508dab608e2e0e799c1bfe5bafaf4caa993a4de46a8a","observation_id":"f55d8983-b1e8-493c-bffa-20b1f34cfd4b","resolution":{"observed_at":"2026-08-11T18:49:28.265273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:28.244064Z","title":"Vcoder: Versatile vision encoders for multimodal large language models,","venue":null,"work_id":"bb35c667-db9c-41c4-98be-388d2ad08aba","year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.594814Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:456c7940cb4bbc8e028fb9f3e5e9e3b1709a0bc27d0ef7e27a0486d7b760b963","observation_id":"72e2f069-7c10-4ada-8e3d-ac6c230b81df","resolution":{"observed_at":"2026-08-11T18:49:28.249868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16045","last_updated":"2024-12-11T02:46:29Z","snapshot_observed_at":"2026-08-16T14:49:14.664860Z","submitted_at":"2023-10-24T17:58:07Z","title":"Woodpecker: Hallucination Correction for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16045","snapshot_observed_at":"2026-08-11T18:49:27.598698Z","title":"Woodpecker: Hallucination correction for multimodal large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.598698Z"},"links":{"cited_paper":"/paper/2310.16045","citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:7b6dcbd1010e452168727ab5a2d3e0a47cac3f2a5dcbb9950b95cf231b3fa755","observation_id":"e2741b30-9e48-47e4-9341-ecc0e587c408","resolution":{"observed_at":"2026-08-11T18:49:27.598698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:27.602779Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.602779Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:faeb1afacf668ec648cbea37085e308c2c28eebd299f4c49d2fbbec940212978","observation_id":"9951bcef-f3c9-489b-87f7-388b2c1af901","resolution":{"observed_at":"2026-08-11T18:49:27.602779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-11T18:49:27.608662Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.608662Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:26df2d3b051d31e02f5fc780bf12a5e8ee3db2b51cf219b43adb53ed4e3c7178","observation_id":"a40d6cf1-3b7f-48dd-a068-df086e3dc9c3","resolution":{"observed_at":"2026-08-11T18:49:27.608662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T18:49:27.614422Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.614422Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:b6b39122fb2b041b8bcef75ed6ea56dcdf4b9256714d43c4a19a00a5ea482cb0","observation_id":"b6053466-ecc6-4b89-8a39-1c8aa5c8b5e7","resolution":{"observed_at":"2026-08-11T18:49:27.614422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-08-16T23:01:47.789827Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-11T18:49:27.618896Z","title":"mplug-owl3: Towards long image-sequence understanding in 15 multi-modal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.618896Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:3df60a4ff69a4e8ee1cccb9d458cfd1e567ae9ff31830cabb40d393b24c515cf","observation_id":"e8e1ba7e-1683-4635-9555-e25e151814b8","resolution":{"observed_at":"2026-08-11T18:49:27.618896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:28.218791Z","title":"Instructblip: Towards general-purpose vision- language models with instruction tuning,","venue":null,"work_id":"84d42fc0-5a66-4b5f-af1d-ef0131e0452c","year":2023},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.623101Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:7ba39692d297de23202ae75eab2c622fa873ee8fd891909256d984c576416872","observation_id":"b9133617-4516-4db2-a2e1-54e31fa98f05","resolution":{"observed_at":"2026-08-11T18:49:28.223464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:28.205027Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond,","venue":null,"work_id":"6932ff73-dcbf-4340-8985-567591ad7e8c","year":2023},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.627639Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:fa5759fa346c2279eaf605c7ddd8809d14679070dda5bd233993dc0f8cbdc173","observation_id":"3ef0f0be-8626-4c68-bd4c-ca0de7cbfa1d","resolution":{"observed_at":"2026-08-11T18:49:28.209398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:28.190667Z","title":"Mitigating fine-grained hallucination by fine-tuning large vision-language models with caption rewrites,","venue":null,"work_id":"75bd18b7-be52-4441-972b-29d4684f9dee","year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.631806Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:0ca9c8aa740689ac3976738f00388355cf8832628d9498ea8e641d29afd21962","observation_id":"5a5be2b5-b9ce-4173-a831-1f7c4950aeb1","resolution":{"observed_at":"2026-08-11T18:49:28.195405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:28.175998Z","title":"Lion: Empowering multimodal large language model with dual-level visual knowledge,","venue":null,"work_id":"c80f2542-dbdd-4a76-bc7f-e85e5255b8f6","year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.635746Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:35242d546acca7d309852e0175696be0fbae49846acdb323a8fe8a081976c85d","observation_id":"512f8840-b312-4dfc-95fa-5d1d3834485d","resolution":{"observed_at":"2026-08-11T18:49:28.180287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18476","last_updated":"2024-02-28T16:57:22Z","snapshot_observed_at":"2026-08-16T14:14:27.512651Z","submitted_at":"2024-02-28T16:57:22Z","title":"IBD: Alleviating Hallucinations in Large Vision-Language Models via Image-Biased Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18476","snapshot_observed_at":"2026-08-11T18:49:27.639497Z","title":"Ibd: Alleviating hallu- cinations in large vision-language models via image-biased decoding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.639497Z"},"links":{"cited_paper":"/paper/2402.18476","citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:79ed138b128b98c899e2cb49ee431868a0d12586fd11bbeaa440fb14ae867efa","observation_id":"29a8c5e6-8923-445a-a651-d985ed64bb6d","resolution":{"observed_at":"2026-08-11T18:49:27.639497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00425","last_updated":"2024-06-10T15:21:41Z","snapshot_observed_at":"2026-08-16T14:13:48.547250Z","submitted_at":"2024-03-01T10:21:52Z","title":"HALC: Object Hallucination Reduction via Adaptive Focal-Contrast Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00425","snapshot_observed_at":"2026-08-11T18:49:27.644096Z","title":"Halc: Object hallucination reduction via adaptive focal-contrast decoding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.644096Z"},"links":{"cited_paper":"/paper/2403.00425","citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:0fff38d0949235d88762d30fb89e405a57df6ee5f3475a3cee6886e495058f53","observation_id":"01b9ae5f-3d87-43d3-b6c4-dd920cd010e9","resolution":{"observed_at":"2026-08-11T18:49:27.644096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00754","last_updated":"2024-03-16T19:28:08Z","snapshot_observed_at":"2026-08-17T08:51:17.513002Z","submitted_at":"2023-10-01T18:10:53Z","title":"Analyzing and Mitigating Object Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00754","snapshot_observed_at":"2026-08-11T18:49:27.650696Z","title":"Analyzing and mitigating object hallucination in large vision- language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.650696Z"},"links":{"cited_paper":"/paper/2310.00754","citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:5b0bdce9ce8cda981baaa7ae330fdcc7307f2c57e972bee759229bfd19a14f1a","observation_id":"c2055866-7ffd-4b4f-91fb-5abb7bce6491","resolution":{"observed_at":"2026-08-11T18:49:27.650696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:28.161226Z","title":"Mit- igating object hallucinations in large vision-language models through visual contrastive decoding,","venue":null,"work_id":"2e47beb5-1e9b-455b-ad25-52d3f74a197a","year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.655768Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:0c508c4c86bd9a503db4de05f085c95d0e7dbfbf9392cf4be515e5ece7473e99","observation_id":"b2919765-6d37-44dd-ae62-efd1334a8ba4","resolution":{"observed_at":"2026-08-11T18:49:28.166497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11622","last_updated":"2024-06-28T07:20:22Z","snapshot_observed_at":"2026-08-16T14:17:35.435756Z","submitted_at":"2024-02-18T15:28:39Z","title":"Logical Closed Loop: Uncovering Object Hallucinations in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11622","snapshot_observed_at":"2026-08-11T18:49:27.660582Z","title":"Logical closed loop: Uncovering object hallucinations in large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.660582Z"},"links":{"cited_paper":"/paper/2402.11622","citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:712229bec686a3a4c2573cc4e1af88143e55169f8f0cde0ffe3b992ab524b092","observation_id":"55f8727b-2365-4b12-930a-b91df6cf3d9e","resolution":{"observed_at":"2026-08-11T18:49:27.660582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07362","last_updated":"2024-04-02T04:12:43Z","snapshot_observed_at":"2026-08-16T14:43:47.033050Z","submitted_at":"2023-11-13T14:26:24Z","title":"Volcano: Mitigating Multimodal Hallucination through Self-Feedback Guided Revision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07362","snapshot_observed_at":"2026-08-11T18:49:27.665183Z","title":"V olcano: mitigating multimodal hallucination through self-feedback guided revision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.665183Z"},"links":{"cited_paper":"/paper/2311.07362","citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:9761cbe633e0098309604c4156d6b0fcecb5caeb081f924922c934a5eac35fed","observation_id":"d8df3984-0dbc-4966-97b0-869cdd951af1","resolution":{"observed_at":"2026-08-11T18:49:27.665183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T18:49:27.670707Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.670707Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:a629847fa86fd70839327cd47c00afe09012cb465a1d0f44bca026ac253141bb","observation_id":"1eb8e3ad-da5c-4577-bb0a-de47a43f624e","resolution":{"observed_at":"2026-08-11T18:49:27.670707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:28.146146Z","title":"Open-set image tagging with multi-grained text supervision,","venue":null,"work_id":"b5b84a39-b6c7-43cf-aa25-8c2cfc6de15e","year":2023},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.675731Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:8ae8ba48bdf7e0662f4b99000f6d6cd90e9dbe09ba7382d516dde5301954014e","observation_id":"3f034bc6-2cab-4524-9aa3-fc71d2f25a07","resolution":{"observed_at":"2026-08-11T18:49:28.151112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-11T18:49:27.681417Z","title":"Grounding dino: Marrying dino with grounded pre- training for open-set object detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.681417Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:71ca8926bd0b9dfed98f870af75f41237eeb7b40074937647d75ddaf05f98ed8","observation_id":"208b4375-f338-4a3f-883a-fe30a2f150fc","resolution":{"observed_at":"2026-08-11T18:49:27.681417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:28.130658Z","title":"Coda: A real-world road corner case dataset for object detection in autonomous driving,","venue":null,"work_id":"f285ff71-bb17-4077-a214-1dd34a4f0e1a","year":2022},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.687925Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:2094abd2a43dc66fc6d38702f0c7c9fe126d7db31e3fd748efd2be6864303823","observation_id":"292d23c6-0e30-4c98-a736-6f5f261554ec","resolution":{"observed_at":"2026-08-11T18:49:28.135875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-16T17:13:28.893408Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-11T18:49:27.692477Z","title":"mplug-owl: Modularization empowers large language models with multimodality,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.692477Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:800a45f7fd25c2af47b4b2c1a41d5eb8c6d2bc2ed3a488d321f771c380e544ff","observation_id":"9c64adaf-e376-4328-9718-990f097e2911","resolution":{"observed_at":"2026-08-11T18:49:27.692477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-11T18:49:27.697705Z","title":"Evaluating object hallucination in large vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.697705Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:e2da2b9bdd8030e10dbeaebde7def468b7a7998f6820890cb986cefaf2b64494","observation_id":"1e63b6dc-b798-45d4-9306-88e30a237e94","resolution":{"observed_at":"2026-08-11T18:49:27.697705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:49:28.113537Z","title":"Segment everything everywhere all at once,","venue":null,"work_id":"e9a1ceb4-e918-4506-90f4-7315ff5199df","year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.702486Z"},"links":{"citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:214e23f37fe1d184e4bb880320b7352d5d6166417802b919014007f6c8db1853","observation_id":"5b66d674-0547-44a6-8d72-1febadd7cbcc","resolution":{"observed_at":"2026-08-11T18:49:28.120382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13616","last_updated":"2024-02-29T03:43:24Z","snapshot_observed_at":"2026-08-16T14:16:41.347547Z","submitted_at":"2024-02-21T08:42:53Z","title":"YOLOv9: Learning What You Want to Learn Using Programmable Gradient Information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13616","snapshot_observed_at":"2026-08-11T18:49:27.706573Z","title":"Yolov9: Learning what you want to learn using programmable gradient information,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.706573Z"},"links":{"cited_paper":"/paper/2402.13616","citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:ab1843707e5db1558b4132ce399b16e09a34912ab5737194900b2f064e254a17","observation_id":"8e2109f5-2072-4528-a0a5-ca5abd320ce1","resolution":{"observed_at":"2026-08-11T18:49:27.706573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14458","last_updated":"2024-10-30T01:49:34Z","snapshot_observed_at":"2026-08-16T19:20:32.438778Z","submitted_at":"2024-05-23T11:44:29Z","title":"YOLOv10: Real-Time End-to-End Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14458","snapshot_observed_at":"2026-08-11T18:49:27.711279Z","title":"Yolov10: Real-time end-to-end object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.711279Z"},"links":{"cited_paper":"/paper/2405.14458","citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:c774b4faef576ffc908eee1995e49cc2a4e98ff0e6f76cf0b13a72971bec130a","observation_id":"dc577c95-21a6-4b8c-b1f3-518356548657","resolution":{"observed_at":"2026-08-11T18:49:27.711279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17725","last_updated":"2024-10-23T09:55:22Z","snapshot_observed_at":"2026-08-13T01:57:27.555320Z","submitted_at":"2024-10-23T09:55:22Z","title":"YOLOv11: An Overview of the Key Architectural Enhancements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17725","snapshot_observed_at":"2026-08-11T18:49:27.716220Z","title":"Yolov11: An overview of the key architectural enhancements,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.716220Z"},"links":{"cited_paper":"/paper/2410.17725","citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:30d5f5cee5e2fbbd8923c8939306d3e7097250b2e63cfb2e5c67f06a3038cbdb","observation_id":"51fa0b9f-dac1-4ff4-bee6-1eec8831baa8","resolution":{"observed_at":"2026-08-11T18:49:27.716220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05657","last_updated":"2024-03-18T12:34:30Z","snapshot_observed_at":"2026-08-16T15:49:20.977075Z","submitted_at":"2023-03-10T02:16:35Z","title":"Tag2Text: Guiding Vision-Language Model via Image Tagging","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05657","snapshot_observed_at":"2026-08-11T18:49:27.720882Z","title":"Tag2text: Guiding vision-language model via image tagging,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.720882Z"},"links":{"cited_paper":"/paper/2303.05657","citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:a049ce7155b6244364ed3ebc5d0d2b33b3441d9016d3a9413f53a39c682f935b","observation_id":"cb5d9ed6-7bbe-4ceb-bbc1-ad7da6072e75","resolution":{"observed_at":"2026-08-11T18:49:27.720882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03514","last_updated":"2023-06-09T15:21:06Z","snapshot_observed_at":"2026-08-16T15:26:15.090405Z","submitted_at":"2023-06-06T09:00:10Z","title":"Recognize Anything: A Strong Image Tagging Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03514","snapshot_observed_at":"2026-08-11T18:49:27.726009Z","title":"Recognize anything: A strong image tagging model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T18:49:27.726009Z"},"links":{"cited_paper":"/paper/2306.03514","citing_paper":"/paper/2412.07518"},"observation_digest":"sha256:fcc591b984e152767421f81f43ebc2ea29a87af036f89f5e66483849a31ee5d9","observation_id":"decb2201-b40a-48ed-b566-63aa403c9615","resolution":{"observed_at":"2026-08-11T18:49:27.726009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.07518","last_updated":"2024-12-10T13:56:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T18:58:05.105081Z","submitted_at":"2024-12-10T13:56:49Z","title":"Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 1 inbound Pith citation observation for arXiv:2412.07518."}