{"as_of":"2026-08-22T18:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8c126b731e8d268164d3f1885996e154f510830cf518f46072d22b537503a4cd","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:31:00.288054Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.18027/citation-record","integrity":"/paper/2504.18027/integrity","json":"/paper/2504.18027/citation-record.json","paper":"/paper/2504.18027"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:01.021278Z","title":"Ingold, The perception of the environment: Essays in livelihood, dwelling and skill","venue":null,"work_id":"2d6712a8-fb69-43b5-aa3e-5852b7a7645f","year":2000},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.070592Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:e05bf0635a277245bc335c66c180710e631f4f9146538a1cc0addff1e3687473","observation_id":"5238b3ec-0889-4319-9ec4-254728d96961","resolution":{"observed_at":"2026-08-16T10:31:01.025469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:01.008942Z","title":"Enabling independent navigation for visually impaired people through a wearable vision-based feedback system,","venue":null,"work_id":"befe3473-60f0-4f13-adc3-532b1ecb2ea5","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.075930Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:72e3a9ba2b54b8fc456cf1214ef08fd87dedce4e0d9004457e3f30749fae8da9","observation_id":"ca42d922-1ed1-460b-bb85-b2b5985e29fc","resolution":{"observed_at":"2026-08-16T10:31:01.012861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.997274Z","title":"Magnitude, temporal trends, and projections of the global prevalence of blindness and distance and near vision impairment: a systematic review and meta-analysis,","venue":null,"work_id":"207ac1d9-9802-4976-a796-01ebc2454337","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.080180Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:b82e8e3866d5a208a0563653d8c696a02540ea7c349f3df94e36afe221457635","observation_id":"81703b36-5f97-486c-8024-ba29eec7ec0c","resolution":{"observed_at":"2026-08-16T10:31:01.000856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.985201Z","title":"Objectively measured visual impairment and dementia prevalence in older adults in the us,","venue":null,"work_id":"6520999b-0f72-4d88-a0be-b79c0d99e036","year":2023},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.083756Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:bf0cdebc2e01895f74e546b86c472d4e1fd5906704a814439883a794d7d3b132","observation_id":"84177a55-74ac-4142-a187-32e566d797ca","resolution":{"observed_at":"2026-08-16T10:31:00.989233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.972386Z","title":"Virtual-blind-road following-based wearable navigation device for blind people,","venue":null,"work_id":"3644af8a-f8a3-414d-a747-e16609270499","year":2018},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.087535Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:d969fbf2b23bf6ce0da27a81f062d5d3e0fef465541c9904662f0f47df975620","observation_id":"4239bd43-dd8e-4050-8236-e43af278c429","resolution":{"observed_at":"2026-08-16T10:31:00.976446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.958464Z","title":"Embedded reading device for blind people: A user-centered design,","venue":null,"work_id":"96e354d0-f3ab-43da-bbab-8bfaaa3f0080","year":2004},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.091100Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:3583382c193fe40256cb013cdccf3e88e96b2e3dba71291f39472ab070ad8fb8","observation_id":"53098e2a-d256-4c56-90fd-bc8e9a837140","resolution":{"observed_at":"2026-08-16T10:31:00.962539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.944897Z","title":"Hand-priming in object localization for assistive egocentric vision,","venue":null,"work_id":"b5e7acab-675d-413c-bf7d-3b0df5e3ac7c","year":2020},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.095164Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:7ff228a825259989bf59981efcd295967e72e77b8fb917f393d9d17e680b0577","observation_id":"0e357f4a-6a50-41a8-ab36-4d3cf8eb07d8","resolution":{"observed_at":"2026-08-16T10:31:00.949264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.931734Z","title":"Vizwiz-fewshot: Locating objects in images taken by people with visual impairments,","venue":null,"work_id":"3d5f491e-54cc-4be9-a671-ab2521ef9eba","year":2022},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.098659Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:527bd4d7f5ea68b253e119187a101b3fd2ab891599aef918585024d208482a9e","observation_id":"7586210f-3cae-425b-a8ab-3aad3216f4e5","resolution":{"observed_at":"2026-08-16T10:31:00.936168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-16T10:31:00.102041Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.102041Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:91f4230719ee92b46bdd1df512814fc8daa8dada3b4328eb1c8cd316887107fc","observation_id":"b8897f6e-bdb0-4ec7-922a-ecd80845d349","resolution":{"observed_at":"2026-08-16T10:31:00.102041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02745","last_updated":"2019-09-06T07:20:17Z","snapshot_observed_at":"2026-08-19T21:54:09.100898Z","submitted_at":"2019-09-06T07:20:17Z","title":"Incorporating External Knowledge into Machine Reading for Generative Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02745","snapshot_observed_at":"2026-08-16T10:31:00.105795Z","title":"Incorporating external knowledge into machine reading for generative question answering,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.105795Z"},"links":{"cited_paper":"/paper/1909.02745","citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:111bf5ee606e3b1aff264f7d767995d0813b9b0050eb06c00decb674324a741d","observation_id":"8362b807-6bb6-49bb-a64b-4545ea3c38fa","resolution":{"observed_at":"2026-08-16T10:31:00.105795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12813","last_updated":"2023-03-08T23:41:49Z","snapshot_observed_at":"2026-08-16T13:28:02.541688Z","submitted_at":"2023-02-24T18:48:43Z","title":"Check Your Facts and Try Again: Improving Large Language Models with External Knowledge and Automated Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12813","snapshot_observed_at":"2026-08-16T10:31:00.109472Z","title":"Check your facts and try again: Improving large language models with external knowledge and auto- mated feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.109472Z"},"links":{"cited_paper":"/paper/2302.12813","citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:a713c80216d9c892f136b7192ee2d0218d981555d28ccb94309bfcc08eb9bd00","observation_id":"7793f1ca-80db-4d2b-bdc9-aacadb2ff268","resolution":{"observed_at":"2026-08-16T10:31:00.109472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.918589Z","title":"Smart guiding glasses for visually impaired people in indoor environment,","venue":null,"work_id":"55364d79-9ae9-49aa-914a-f6181a473f67","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.113421Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:ac02405024d33583aef55c5952ed9e011b00927c830054a7541ea75bbecf4637","observation_id":"6c32a6fa-7e82-4595-9138-59c04d5d0d6e","resolution":{"observed_at":"2026-08-16T10:31:00.922921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.906013Z","title":"An enhanced obstacle avoidance method for the visually impaired using deformable grid,","venue":null,"work_id":"4c8ee9d6-3b89-4331-b8df-0f71a5833a6e","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.117676Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:843251681e4cc430083af1624ff0c298b0730c37666a7c5189e10e4051407895","observation_id":"476705bc-afe4-4c72-85e4-c95e66a421d9","resolution":{"observed_at":"2026-08-16T10:31:00.910049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.892737Z","title":"Collision detection method using image segmentation for the visually impaired,","venue":null,"work_id":"bc7d402f-d506-4381-a6b2-9c4ab8c9c6d8","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.121663Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:a709568ab55fabfdd82b7295304c489b2cc04b72117a414b7284cba81b371d1e","observation_id":"4131347c-bc28-441d-8b39-f54f3886c515","resolution":{"observed_at":"2026-08-16T10:31:00.897088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.880508Z","title":"Tdraw: A computer-based tactile drawing tool for blind people,","venue":null,"work_id":"206e382a-3c72-43ca-9c68-0480112ba80e","year":1996},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.125470Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:a02f59da149c28ccaa815fedc155fba51ae569c5e2bcce249868175a40d7e817","observation_id":"2f7d754c-8d43-45c7-aac0-9c60342808ac","resolution":{"observed_at":"2026-08-16T10:31:00.884312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.868813Z","title":"Usable gestures for blind people: Understanding preference and performance,","venue":null,"work_id":"e1f0cba6-c5c5-4dd1-950e-b420d6b9998e","year":2011},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.129243Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:c485d087487f00276f6147d43bc0728010c72954b29da440fb7075836c9137eb","observation_id":"6c449d9b-0b3f-4423-bd65-fe56bd35dabe","resolution":{"observed_at":"2026-08-16T10:31:00.872328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.856515Z","title":"How teens with visual impairments take, edit, and share photos on social media,","venue":null,"work_id":"e7e274be-17ce-47af-a7cb-4891d42b25fd","year":2018},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.133075Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:2ef1f41cfd6e07ff6f33cabf28752f07bf37a3f33b4e670df51cba78a1e95168","observation_id":"a716678e-67de-4f5c-84de-4918c397b659","resolution":{"observed_at":"2026-08-16T10:31:00.860378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.843323Z","title":"Flight: A low-cost reading and writing system for economically less-privileged visually-impaired people exploiting ink-based braille system,","venue":null,"work_id":"36875663-3eb8-4b8b-b05c-09f937150632","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.136838Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:908ad6bafc29cbbeb4cabac1c1565bdf8f5f4d344316d36d36589841404cf019","observation_id":"9f894f49-d49e-4c92-9fbd-8845beb8ba1e","resolution":{"observed_at":"2026-08-16T10:31:00.847723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.830481Z","title":"Linespace: A sensemaking platform for the blind,","venue":null,"work_id":"1f684bcc-9077-4078-82b2-ac4ca18304e6","year":2016},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.140734Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:d795470d549c8fe38925752f7de57a70e422d3c2ad549d1b800dd1c5bab3a642","observation_id":"5f6859ed-659e-41b2-af1e-c7fe1ff43ee5","resolution":{"observed_at":"2026-08-16T10:31:00.834865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.817478Z","title":"Tangible reels: Construction and exploration of tangible maps by visually impaired users,","venue":null,"work_id":"604dfcdd-ae30-404d-8886-64a0c68c6fee","year":2016},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.144554Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:382af0974d7a0d12b4ff694932c6bf1e0c284c624fe5f2b95f3cc8926a5f8e17","observation_id":"8ab3b6b7-2fae-428c-94a4-91c5f5189655","resolution":{"observed_at":"2026-08-16T10:31:00.821638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.803987Z","title":"Comparing computer- based drawing methods for blind people with real-time tactile feed- back,","venue":null,"work_id":"c43dd342-be1e-4049-875c-bf10db6a87db","year":2018},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.148569Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:bd4985fa4a31613dfc1fbca75ba8a4ef54d5aa903cdda8edb4af256c89b2830b","observation_id":"2745375e-50b7-476d-bfe5-2047884835fc","resolution":{"observed_at":"2026-08-16T10:31:00.808129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.790897Z","title":"Accessible maps for the blind: comparing 3d printed models with tactile graphics,","venue":null,"work_id":"abfff37c-7cf9-4470-8891-0619660b96d3","year":2018},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.152475Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:2d93837d1c79c90ed1f9a8d95d28acf45f4751368c64376d20c4b2ace419d5ea","observation_id":"ee460e25-8e79-460d-9ac2-3ffa77a00f2f","resolution":{"observed_at":"2026-08-16T10:31:00.795103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.778209Z","title":"Taking into account sensory knowledge: The case of geo-techologies for children with visual impairments,","venue":null,"work_id":"7197721b-5213-4654-91e3-24b9e810ac6c","year":2018},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.156325Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:3b406cc9fe29934a61daf73bd2c86c59ba8867c61cd781a98f07e1911eee9193","observation_id":"4f9b320c-d7ba-45bf-b420-4a433b9245b0","resolution":{"observed_at":"2026-08-16T10:31:00.782295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.765678Z","title":"People with visual impairment training personal object recognizers: feasibility and challenges,","venue":null,"work_id":"5a36451e-442d-4593-8dc1-d7e5a9514db3","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.160306Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:a8663579d1a2a949b943230ed561213b67e9666d5d4a38de26dde98dee9cb939","observation_id":"2c4c0c9f-7df3-4901-bf1b-846fbdbee5cc","resolution":{"observed_at":"2026-08-16T10:31:00.769894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.752924Z","title":"Synthesizing stroke gestures across user populations: A case for users with visual im- pairments,","venue":null,"work_id":"8dd65ff5-c9f3-46dd-a3da-e58701372f39","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.164179Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:d68fc3cdd3d58dff90fb6355155ca94b2fc76248ae4aa36aad0f27b046e58fe6","observation_id":"2d119cea-d298-4215-973f-999cd590083f","resolution":{"observed_at":"2026-08-16T10:31:00.756993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.740497Z","title":"A face recognition application for people with visual impairments: Understanding use beyond the lab,","venue":null,"work_id":"c8afd332-cedd-42db-baaf-0cef7e1de1a4","year":2018},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.167995Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:03be841470b1f43915510b1289405d50a7a3aea69fc429454b8c509fa5022ae9","observation_id":"5a758cf3-9155-4672-9e47-5c8ec60709dd","resolution":{"observed_at":"2026-08-16T10:31:00.744620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.727891Z","title":"A multitask grocery assist system for the visually impaired: Smart glasses, gloves, and shopping carts provide auditory and tactile feedback,","venue":null,"work_id":"49a60959-e936-4119-b490-177bb748a62e","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.171921Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:21e7b87846fb358325d4f0b779e961a1c65153c24aaa4ddab22739106a9aabc9","observation_id":"96ec5311-e479-40ed-ba47-8d60998fa60b","resolution":{"observed_at":"2026-08-16T10:31:00.731875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.715426Z","title":"Hindsight: Enhancing spa- tial awareness by sonifying detected objects in real-time 360-degree video,","venue":null,"work_id":"c8dfa977-8f97-4d86-b79f-a5a8df745e8d","year":2018},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.175848Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:d135efb6caf478053f8918bb501f42ed63ddc2bb6a7233ea94250e7d196560a4","observation_id":"6b9f7371-ff12-4baa-af1e-4f1a343d138a","resolution":{"observed_at":"2026-08-16T10:31:00.719664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.702333Z","title":"You only look once: Unified, real-time object detection,","venue":null,"work_id":"6c186df6-5652-4465-84cb-e8f141337665","year":2016},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.180050Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:27dc371e9b762c5abef0ad2853c88381a268540ff9700243372c5d4cca047c80","observation_id":"66c24848-801b-43a9-bba2-e0ddc698e84d","resolution":{"observed_at":"2026-08-16T10:31:00.706770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.688635Z","title":"Ssd: Single shot multibox detector,","venue":null,"work_id":"3b16e757-fcd0-440e-a114-dca514ec29e8","year":2016},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.183925Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:f17af456e606f8b49448dd8a5d3284591fa53889b06ec8dd61b4e08ae00f7bc1","observation_id":"782940ce-8c74-4448-bfb2-673331de9336","resolution":{"observed_at":"2026-08-16T10:31:00.692788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.674655Z","title":"Rich feature hierarchies for accurate object detection and semantic segmentation,","venue":null,"work_id":"ed624bdd-2959-4500-aa9a-1deafaea0605","year":2014},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.187686Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:69b8f6ab2c9e4bf84a9e797336903436b0de6efccb8e60a53a372e86beea45ae","observation_id":"2ee8d73a-286f-4d23-b07d-2e3cb947d673","resolution":{"observed_at":"2026-08-16T10:31:00.679459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.660920Z","title":"Faster r-cnn: Towards real- time object detection with region proposal networks,","venue":null,"work_id":"5be4e6bd-3e99-44ec-b949-8cf700b87ebe","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.191599Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:5eb3cd519aad3cbf328c2104ca5efa8c59204bad25bb79edb0875313343ad5d2","observation_id":"db88033f-d8b6-4980-86b5-a4533595940e","resolution":{"observed_at":"2026-08-16T10:31:00.665125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.648452Z","title":"Fully convolutional networks for semantic segmentation,","venue":null,"work_id":"63d82340-7aee-4863-9447-852137dcac0f","year":2015},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.195421Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:bf99161fdf95b06d588442602ead126618a455ae0b3c6821768df5550baeadb8","observation_id":"a194552c-df25-496f-8c23-442091595cf6","resolution":{"observed_at":"2026-08-16T10:31:00.652065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.636738Z","title":"Segnet: A deep convolutional encoder-decoder architecture for scene segmentation,","venue":null,"work_id":"cc8adc96-177c-44cf-9650-3a5ac9d24c18","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.199320Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:75b5539096d6bc7c22cdeb25604d83527629f5874d0a4923bb58d869d72a8491","observation_id":"cd9f58ff-1615-4cc4-a81e-1e7964239d26","resolution":{"observed_at":"2026-08-16T10:31:00.640256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.624791Z","title":"Deeplab: Semantic image segmentation with deep convolutional nets, atrous convolution, and fully connected crfs,","venue":null,"work_id":"ca2784a4-6265-423b-ba6a-dcf4fdcc25d6","year":2018},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.203093Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:c6efd649eaa5f2446e3bd7e56c53555647e55071e42b853c2af05640a11a5916","observation_id":"a944ebca-3c19-4ccc-9772-cbc211c6bffc","resolution":{"observed_at":"2026-08-16T10:31:00.628702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.612669Z","title":"Rethinking semantic segmentation from a sequence-to-sequence perspective with transformers,","venue":null,"work_id":"007c46f2-39b8-48cd-acaa-02dd9402f848","year":2021},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.206866Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:fa7ce05bc04b00af97ec6e6b0343481fe5294a4e0bd07a72bdb9656e97399eca","observation_id":"9150d598-d671-489d-9a03-c988fa2185f2","resolution":{"observed_at":"2026-08-16T10:31:00.616863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.210929Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.210929Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:550ed3e7843f8514a288b110d6f662471d8b21400b1bb25042dc4f0c7ce350e5","observation_id":"f05c32a9-1f5b-4acf-8032-411eef2c3f9c","resolution":{"observed_at":"2026-08-16T10:31:00.210929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.214911Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.214911Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:84dff5d284d7b4ad0c032bc9dba6f902438fcd3d8adef6ec9e65a7e093cc6874","observation_id":"f399b1a3-0bdb-41c3-b49f-62bc9b3321ba","resolution":{"observed_at":"2026-08-16T10:31:00.214911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.584097Z","title":"Fusenet: In- corporating depth into semantic segmentation via fusion-based cnn architecture,","venue":null,"work_id":"c6ad60a8-46e2-4b89-aa59-635a20f73bc0","year":2016},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.218978Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:7e7535cab8ad35bc3815c289077d4e4a67d8d899e1afd800b43a9d45bc04409f","observation_id":"dc472b25-ca38-4440-bc89-769d0e8f45b2","resolution":{"observed_at":"2026-08-16T10:31:00.588242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.01054","last_updated":"2018-08-06T17:11:25Z","snapshot_observed_at":"2026-08-14T19:07:52.788158Z","submitted_at":"2018-06-04T11:33:57Z","title":"RedNet: Residual Encoder-Decoder Network for indoor RGB-D Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.01054","snapshot_observed_at":"2026-08-16T10:31:00.223131Z","title":"Rednet: Residual encoder- decoder network for indoor rgb-d semantic segmentation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.223131Z"},"links":{"cited_paper":"/paper/1806.01054","citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:8529c05d808bca9147a8553f91e22bf169928372a5d6300c10e3dd1e37a729f6","observation_id":"ff2e631d-caab-4573-9575-50ff1d525f6c","resolution":{"observed_at":"2026-08-16T10:31:00.223131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.571138Z","title":"Show and tell: A neural image caption generator,","venue":null,"work_id":"1daa2c3c-83df-4f3a-b12f-58f486b047ea","year":2015},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.227421Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:00fb96c39f41d706b818953319be3f83c9be9b300c3243c0d7a7437812edffdd","observation_id":"740e6dea-7417-46aa-b70a-34ceda40eef0","resolution":{"observed_at":"2026-08-16T10:31:00.575223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.557706Z","title":"Knowing when to look: Adaptive attention via a visual sentinel for image captioning,","venue":null,"work_id":"c4bf632d-f560-4a06-8639-f762520ac315","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.231212Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:dbf012e31492a8a517cfacf8a5623c704b023e37721e2c0566909491ee1aeaee","observation_id":"c8b8e99b-6775-45f8-9922-73d45b06afb5","resolution":{"observed_at":"2026-08-16T10:31:00.561847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.235162Z","title":"Show, attend and tell: Neural image caption generation with visual attention,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.235162Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:6859053060509f7cc399013a8b7de10fb88e577b57f53efe80f621dde412183e","observation_id":"b953f83a-e732-4730-9bd1-1cee6bfa1a0e","resolution":{"observed_at":"2026-08-16T10:31:00.235162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.536464Z","title":"Dense captioning with joint inference and visual context,","venue":null,"work_id":"10b86934-777f-4b5b-850b-526bffb1a9ac","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.239060Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:512cfe8a78ee0079c084c9a931d282e9a85ecf5661afca8ca3a5e0786fb725bd","observation_id":"cc6bd0fe-de3c-42c2-8f77-dbe17d3ac78a","resolution":{"observed_at":"2026-08-16T10:31:00.540912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.243006Z","title":"Unifying vision-and-language tasks via text generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.243006Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:c47019b1f1e33162b394c1f88df8528e330897e492e9a1585fbac9f9e6a1513c","observation_id":"2964a558-64f0-4877-926c-80e27e40cccd","resolution":{"observed_at":"2026-08-16T10:31:00.243006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.514586Z","title":"Multimodal few-shot learning with frozen language models,","venue":null,"work_id":"e1fe8e8f-8969-4982-aa40-deab1a0048a2","year":2021},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.246908Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:b726aaa4d54dff6373ff3dde26664a23eba850369c5c81e3582acac3be9693d3","observation_id":"a970cb18-308b-40d8-8047-b79c31476024","resolution":{"observed_at":"2026-08-16T10:31:00.518885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-16T10:31:00.250761Z","title":"Simvlm: Simple visual language model pretraining with weak supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.250761Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:e7f58a23f9657c643a7627b3345d735bb77323dde3440fa0d60eac6a27b4486e","observation_id":"defa57c1-c932-44b8-b1d4-1991733ba014","resolution":{"observed_at":"2026-08-16T10:31:00.250761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.254925Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.254925Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:0196ea739c5f2f2d796ae56b0124c11b1121e9a6c4581aebfd7ed4fb9899752b","observation_id":"3618de6a-eedf-4b2d-b03a-ce85522cbad0","resolution":{"observed_at":"2026-08-16T10:31:00.254925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-20T12:00:24.760146Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-16T10:31:00.258268Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.258268Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:48a20b452fa16943ee656cbab78b66ca32f098ddb1c2f7b5aed228a844c375aa","observation_id":"73657ceb-f69e-4b10-ac8f-332c7648fdbf","resolution":{"observed_at":"2026-08-16T10:31:00.258268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.492285Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":"c765eaf8-9e9a-4b28-911b-b90c0ee941a8","year":2022},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.261705Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:3b7ba6a9d3fff9acdd84637106df475e5546d28f8e2add86eabe09a3d9643236","observation_id":"ced62b91-54c3-45b1-9e08-05e7e56ae140","resolution":{"observed_at":"2026-08-16T10:31:00.496661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06394","last_updated":"2024-02-11T08:38:07Z","snapshot_observed_at":"2026-08-18T12:58:26.782246Z","submitted_at":"2023-08-11T21:35:20Z","title":"Detecting and Preventing Hallucinations in Large Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06394","snapshot_observed_at":"2026-08-16T10:31:00.264996Z","title":"Detecting and preventing hallucinations in large vision language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.264996Z"},"links":{"cited_paper":"/paper/2308.06394","citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:b5995c44ecaf571e39c3d4c87931805e1eccfaee1a4d089c07ca2f79b935aa43","observation_id":"f9486fcb-4b5a-4fea-b769-c90404a7b5a3","resolution":{"observed_at":"2026-08-16T10:31:00.264996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-15T23:41:03.981699Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-16T10:31:00.268434Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.268434Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:b79408f3d738004fcd04a51f7486302f2058b57057e5c3c0b00376b767d97249","observation_id":"34c754b0-afdb-4e51-8015-78cbd4d6f1ad","resolution":{"observed_at":"2026-08-16T10:31:00.268434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04041","last_updated":"2024-01-13T03:02:12Z","snapshot_observed_at":"2026-08-22T07:57:19.621240Z","submitted_at":"2023-09-07T22:59:56Z","title":"Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04041","snapshot_observed_at":"2026-08-16T10:31:00.272098Z","title":"Evaluation and mitigation of agnosia in multimodal large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.272098Z"},"links":{"cited_paper":"/paper/2309.04041","citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:bcfb107d298cfa561643cafa565701de91afa4fa4204fabe052c28f173b5fbca","observation_id":"c50934a6-876e-45e6-8396-b10a0d94a28d","resolution":{"observed_at":"2026-08-16T10:31:00.272098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16045","last_updated":"2024-12-11T02:46:29Z","snapshot_observed_at":"2026-08-18T12:54:07.136498Z","submitted_at":"2023-10-24T17:58:07Z","title":"Woodpecker: Hallucination Correction for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16045","snapshot_observed_at":"2026-08-16T10:31:00.276120Z","title":"Woodpecker: Hallucination cor- rection for multimodal large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.276120Z"},"links":{"cited_paper":"/paper/2310.16045","citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:cbd8a59458a04e8616c25f8ef60859c709b1d6f630bdf5572af39adabb496e9e","observation_id":"bbbcd020-b0fb-4e83-bc27-793dbb5472e9","resolution":{"observed_at":"2026-08-16T10:31:00.276120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.476853Z","title":"Qwen-vl: A versatile vision-language model for under- standing, localization, text reading, and beyond,","venue":null,"work_id":"dc597937-a2f3-4f79-bf97-a0f8f880de7e","year":2023},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.280139Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:aa0e3b0886ac9b652e511d12cd9fd10ef6638dfbf7f0a9a7be446ec71746bdcf","observation_id":"ea7e7403-23df-49dd-ada6-ca04bb3f694c","resolution":{"observed_at":"2026-08-16T10:31:00.482844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-16T10:31:00.283944Z","title":"Evaluating object hallucination in large vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.283944Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:f7bb3bea129f1ecf6d862c65187eed3c521400a3adcd1d5201382e645eee8e42","observation_id":"d2610f5d-784e-4134-b3e9-d6f8c114c06b","resolution":{"observed_at":"2026-08-16T10:31:00.283944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-16T10:31:00.288054Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.288054Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:df544ee45dd41fe525f6f39114a3a070667c5ba32c9117e94c11ba3071e8b247","observation_id":"41a2c272-c971-410a-a7a6-7bb40030c138","resolution":{"observed_at":"2026-08-16T10:31:00.288054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T16:42:53.394418Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2504.18027."}